Video Reasoning Causal Debiasing Lightweight MLLM Reinforcement Learning
摘要

尽管强化学习提升了多模态大模型的推理能力,但在轻量级模型中效果受限。本文通过因果分析揭示,基于 RL 的微调促使轻量级模型依赖数据偏差导致的感知捷径,而非发展真正的推理能力。为此,我们提出 VideoThinker 框架,采用两阶段去偏策略:首先训练“偏差模型”捕捉捷径行为,随后利用因果去偏策略优化算法,通过排斥目标迫使主模型远离错误逻辑并趋向正确解。实验表明,VideoThinker-R1 在视频推理效率上达到最先进水平,仅需少量数据进行 RL 且无需监督微调,即在多个基准测试中超越更大规模模型。

AI 推荐理由

论文核心解决轻量级 MLLM 的视频推理偏差问题,提出因果去偏框架以提升泛化推理能力。

研究机构
Sun Yat-sen University, China
论文信息
作者 Jingze Wu, Quan Zhang, Hongfei Suo, Zeqiang Cai, Hongbo Chen
发布日期 2026-05-02
arXiv ID 2605.01324
相关性评分 9/10 (高度相关)