Multimodal Reasoning Reinforcement Learning Cycle Consistency
摘要

稳健的感知与推理需要跨感官模态的一致性。然而,当前多模态模型常违背此原则,导致对同一概念的视觉与文本表征产生矛盾预测。本文提出 R-C2,一种通过强制跨模态循环一致性来解决内部冲突的强化学习框架。该框架要求模型执行反向推断、切换模态并通过正向推断可靠重构答案,从而获得密集且无需标签的奖励信号。这种循环约束促使模型自主对齐内部表征,有效缓解特定模态错误,将推理准确率最高提升 7.6 个点。

AI 推荐理由

论文核心提出通过跨模态循环一致性强化学习提升多模态推理能力,直接针对推理机制。

研究机构
Rutgers University Columbia University University of Chicago
论文信息
作者 Zirui Zhang, Haoyu Dong, Kexin Pei, Chengzhi Mao
发布日期 2026-03-26
arXiv ID 2603.25720
相关性评分 9/10 (高度相关)