LVLM RLVR Multimodal Reasoning Credit Assignment
摘要

针对现有基于可验证奖励的强化学习(RLVR)在多模态推理中因均匀分配优势而稀释关键视觉信号的问题,本文提出“令牌视觉依赖”概念,量化视觉输入的因果信息增益。据此,我们设计了感知基础策略优化(PGPO)框架,通过阈值门控机制在令牌级别动态重塑优势分布,放大视觉依赖令牌的学习信号并抑制语言先验噪声。在七个多模态推理基准上的实验表明,该方法平均提升模型性能 18.7%,有效降低梯度方差并防止训练崩溃,实现了鲁棒的感知基础多模态推理。

AI 推荐理由

论文核心解决多模态推理中的信用分配问题,通过细粒度优化显著提升推理能力。

研究机构
Harbin Institute of Technology Huawei Technologies Co., Ltd.
论文信息
作者 Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li et al.
发布日期 2026-04-02
arXiv ID 2604.01840
相关性评分 9/10 (高度相关)