摘要
稳健的感知与推理需要跨感官模态的一致性。然而,当前多模态模型常违背此原则,导致对同一概念的视觉与文本表征产生矛盾预测。本文提出 R-C2,一种通过强制跨模态循环一致性来解决内部冲突的强化学习框架。该框架要求模型执行反向推断、切换模态并通过正向推断可靠重构答案,从而获得密集且无需标签的奖励信号。这种循环约束促使模型自主对齐内部表征,有效缓解特定模态错误,将推理准确率最高提升 7.6 个点。
AI 推荐理由
论文核心提出通过跨模态循环一致性强化学习提升多模态推理能力,直接针对推理机制。
研究机构
Rutgers University
Columbia University
University of Chicago
论文信息