摘要
传统可验证奖励强化学习依赖稀疏结果信号,而细粒度内在信号虽能提升文本推理,但直接应用于视觉语言任务效果不佳。因该任务混合了稀疏视觉感知与密集文本推理,全局归一化导致视觉步骤信号失真。本文提出感知分解置信度奖励(PDCR)框架,通过无监督技能分解引入视觉依赖评分,将感知与推理步骤聚类分离。在此基础上,PDCR 在各技能簇内分别计算分解优势,为两类步骤提供稳定且尺度正确的训练信号。实验表明,PDCR 在关键视觉语言推理基准上优于全局奖励及稀疏奖励基线。
AI 推荐理由
论文核心提出 PDCR 框架,通过解耦感知与推理步骤优化视觉语言模型的推理训练信号。
研究机构
Korea Advanced Institute of Science and Technology (KAIST)
University of Illinois at Urbana-Champaign (UIUC)
Microsoft Research Asia (MSRA)
论文信息