摘要
针对现有可验证奖励强化学习(RLVR)在多模态推理中依赖轨迹级奖励导致信用分配粗糙的问题,本文提出感知强化策略优化(PRPO)。该方法引入鲁棒视觉依赖(RVD)指标识别关键感知令牌,并利用感知优势重塑(PAR)技术进行令牌级信用分配,增强视觉证据的 Supervision。实验表明,PRPO 在多个基准上显著优于现有基线,提升了训练效率与跨任务泛化能力,证明了细粒度信用分配对多模态推理的重要性。
AI 推荐理由
论文核心旨在通过细粒度奖励分配提升多模态模型的推理能力,直接针对推理过程中的因果归因问题。
研究机构
Amap CV Lab, Alibaba Group
Peking University
论文信息