多模态推理 强化学习 轨迹监督 奖励建模
摘要

可验证奖励的强化学习(RLVR)虽能提升多模态推理,但常导致“推理 - 答案不一致”,即答案正确却依赖薄弱证据或矛盾推导。为此,本文探讨轨迹监督方法,对比奖励模型与生成式奖励的优劣,并提出“分组排序奖励”机制。该方法在同一批次中对通过验证的轨迹进行排序并重新分配奖励,以更高效地区分强弱正确轨迹。实验表明,该方法显著缓解了不一致性,将条件准确率从 47.4% 提升至 54.7%。

AI 推荐理由

论文核心解决多模态推理中答案正确与推导无效的不一致问题,提出新奖励机制提升推理可靠性。

研究机构
University of Notre Dame
论文信息
作者 Mengzhao Jia, Zhihan Zhang, Meng Jiang
发布日期 2026-04-20
arXiv ID 2604.18892
相关性评分 9/10 (高度相关)