Multimodal Reasoning Reinforcement Learning Hallucination MLLM
摘要

近期强化学习(RL)在大型推理模型中的成功推动了其在多模态大语言模型(MLLM)后训练中的应用,以增强视觉推理能力。然而,RL 训练是否真正使模型学会利用视觉信息尚不明确。本文提出“幻觉即线索”框架,通过引入特定模态的破坏性干扰,迫使模型依赖幻觉进行推理,从而诊断 RL 训练动态。实验表明,即使在纯幻觉诱导设置下,RL 后训练仍能显著提升推理性能,甚至优于标准训练。这一发现挑战了现有假设,推动了更具模态感知能力的 RL 训练设计发展。

AI 推荐理由

论文核心研究多模态模型的视觉推理能力,分析幻觉在强化学习训练中对推理性能的影响机制。

研究机构
University of North Carolina at Chapel Hill
论文信息
作者 Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub et al.
发布日期 2026-04-03
arXiv ID 2604.03179
相关性评分 9/10 (高度相关)