摘要
基于可验证奖励的强化学习(RLVR)在视觉推理领域进展显著,但现有方法在处理多源输入时,往往将其视为信息的简单累积,缺乏区分信息增益与干扰的机制。这导致在整合物理属性或语义差异巨大的多源数据(如红外与深度)时,动态交互建模失效,甚至不如单源推理。为此,本文提出 MARS 框架,将各视觉模态视为独立信息源,利用单源奖励作为动态锚点,在优势归一化中显式融入多源融合的信息增益,自适应地增强源间协同并抑制噪声冲突。理论与实验表明,该方法能有效量化梯度估计中的信息增益,在多个数据集上显著优于基线。
AI 推荐理由
论文核心提出多源视觉推理框架,解决信息融合干扰问题,显著提升推理性能。
研究机构
Tsinghua University
Northwest Polytechnical University
Beijing Jiaotong University
论文信息