Visual Reasoning Reinforcement Learning Multi-source Fusion Advantage Normalization
摘要

基于可验证奖励的强化学习(RLVR)在视觉推理领域进展显著,但现有方法在处理多源输入时,往往将其视为信息的简单累积,缺乏区分信息增益与干扰的机制。这导致在整合物理属性或语义差异巨大的多源数据(如红外与深度)时,动态交互建模失效,甚至不如单源推理。为此,本文提出 MARS 框架,将各视觉模态视为独立信息源,利用单源奖励作为动态锚点,在优势归一化中显式融入多源融合的信息增益,自适应地增强源间协同并抑制噪声冲突。理论与实验表明,该方法能有效量化梯度估计中的信息增益,在多个数据集上显著优于基线。

AI 推荐理由

论文核心提出多源视觉推理框架,解决信息融合干扰问题,显著提升推理性能。

研究机构
Tsinghua University Northwest Polytechnical University Beijing Jiaotong University
论文信息
作者 Fanhu Zeng, Zhicong Luo, Zefan Wang, You Li, Chi Chen et al.
发布日期 2026-05-25
arXiv ID 2605.25437
相关性评分 9/10 (高度相关)