摘要
视觉语言模型(VLMs)在复杂推理任务中常因视觉感知错误和幻觉导致答案不准确。尽管基于可验证奖励的强化学习(RLVR)能有效优化策略,但现有方法存在采样预算浪费及稀疏奖励无法区分感知与推理失败根源的问题。本文提出 MIRL 框架,利用生成描述与视觉输入间的互信息作为低成本预筛选信号,智能分配预算至高潜力轨迹,并通过解耦训练提供独立的互信息奖励以优化视觉感知,解决奖励盲区问题。实验表明,MIRL 在六个基准测试中平均准确率达 70.22%,显著优于传统采样方法。
AI 推荐理由
论文核心解决视觉语言模型在复杂推理任务中的幻觉与感知错误,通过强化学习提升推理准确性。
研究机构
Equal contribution, School of Mathematics, Tianjin University, Tianjin, China
School of Mathematics, Tianjin University, Tianjin, China
论文信息