摘要
尽管强化学习提升了多模态大模型的推理能力,但在轻量级模型中效果受限。本文通过因果分析揭示,基于 RL 的微调促使轻量级模型依赖数据偏差导致的感知捷径,而非发展真正的推理能力。为此,我们提出 VideoThinker 框架,采用两阶段去偏策略:首先训练“偏差模型”捕捉捷径行为,随后利用因果去偏策略优化算法,通过排斥目标迫使主模型远离错误逻辑并趋向正确解。实验表明,VideoThinker-R1 在视频推理效率上达到最先进水平,仅需少量数据进行 RL 且无需监督微调,即在多个基准测试中超越更大规模模型。
AI 推荐理由
论文核心解决轻量级 MLLM 的视频推理偏差问题,提出因果去偏框架以提升泛化推理能力。
研究机构
Sun Yat-sen University, China
论文信息