摘要
近期强化学习(RL)在大型推理模型中的成功推动了其在多模态大语言模型(MLLM)后训练中的应用,以增强视觉推理能力。然而,RL 训练是否真正使模型学会利用视觉信息尚不明确。本文提出“幻觉即线索”框架,通过引入特定模态的破坏性干扰,迫使模型依赖幻觉进行推理,从而诊断 RL 训练动态。实验表明,即使在纯幻觉诱导设置下,RL 后训练仍能显著提升推理性能,甚至优于标准训练。这一发现挑战了现有假设,推动了更具模态感知能力的 RL 训练设计发展。
AI 推荐理由
论文核心研究多模态模型的视觉推理能力,分析幻觉在强化学习训练中对推理性能的影响机制。
研究机构
University of North Carolina at Chapel Hill
论文信息