VLM Reinforcement Learning Process Supervision Multimodal Reasoning
摘要

视觉语言模型(VLM)常采用类 GRPO 训练进行对齐,但仅依赖终端结果奖励会导致多步推理中信用分配稀疏,削弱视觉证据与中间步骤的关联,引发优化不稳定及视觉幻觉。本文提出“差异反馈”方法,通过修复错误推理轨迹自动生成令牌/步骤级监督掩码,明确标记需修正的关键位置。该方法无需昂贵的人工逐步标注,即可实现过程级视觉对齐,并无缝集成至现有框架。在 MMMStar 和 MathVista 等多模态推理基准上的实验表明,同等算力下平均性能提升 3%。

AI 推荐理由

论文核心解决多步推理中的稀疏奖励分配问题,通过过程级监督增强视觉 - 推理对齐。

研究机构
Shenzhen International Graduate School, Tsinghua University, China
论文信息
作者 Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu et al.
发布日期 2026-03-29
arXiv ID 2603.27482
相关性评分 9/10 (高度相关)