摘要
针对现有基于可验证奖励的强化学习(RLVR)在多模态推理中因均匀分配优势而稀释关键视觉信号的问题,本文提出“令牌视觉依赖”概念,量化视觉输入的因果信息增益。据此,我们设计了感知基础策略优化(PGPO)框架,通过阈值门控机制在令牌级别动态重塑优势分布,放大视觉依赖令牌的学习信号并抑制语言先验噪声。在七个多模态推理基准上的实验表明,该方法平均提升模型性能 18.7%,有效降低梯度方差并防止训练崩溃,实现了鲁棒的感知基础多模态推理。
AI 推荐理由
论文核心解决多模态推理中的信用分配问题,通过细粒度优化显著提升推理能力。
研究机构
Harbin Institute of Technology
Huawei Technologies Co., Ltd.
论文信息