Multimodal Reasoning Reinforcement Learning Visual Attention VLM
摘要

可验证奖励的强化学习(RLVR)虽提升了视觉语言模型(VLM)的推理能力,但其文本主导特性常导致视觉忠实度不足及推理过程中的时序视觉遗忘。为此,本文提出视觉引导策略优化(VGPO)框架。该框架引入视觉注意力补偿机制,利用视觉相似性定位并放大视觉线索,逐步提升后期步骤的视觉期望以对抗遗忘。此外,实施了双粒度优势重加权策略:轨迹内层面突出高视觉激活令牌,轨迹间层面优先选择视觉累积更优的轨迹。实验表明,VGPO 在数学多模态推理及视觉依赖任务中实现了更强的视觉激活与卓越性能。

AI 推荐理由

论文核心解决多模态推理中的视觉遗忘问题,提出新框架显著提升推理能力。

研究机构
AMAP, Alibaba Group
论文信息
作者 Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang et al.
发布日期 2026-04-10
arXiv ID 2604.09349
相关性评分 9/10 (高度相关)