Vision-Language Reasoning Reinforcement Learning Reward Modeling Skill Decomposition
摘要

传统可验证奖励强化学习依赖稀疏结果信号,而细粒度内在信号虽能提升文本推理,但直接应用于视觉语言任务效果不佳。因该任务混合了稀疏视觉感知与密集文本推理,全局归一化导致视觉步骤信号失真。本文提出感知分解置信度奖励(PDCR)框架,通过无监督技能分解引入视觉依赖评分,将感知与推理步骤聚类分离。在此基础上,PDCR 在各技能簇内分别计算分解优势,为两类步骤提供稳定且尺度正确的训练信号。实验表明,PDCR 在关键视觉语言推理基准上优于全局奖励及稀疏奖励基线。

AI 推荐理由

论文核心提出 PDCR 框架,通过解耦感知与推理步骤优化视觉语言模型的推理训练信号。

研究机构
Korea Advanced Institute of Science and Technology (KAIST) University of Illinois at Urbana-Champaign (UIUC) Microsoft Research Asia (MSRA)
论文信息
作者 Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo et al.
发布日期 2026-05-13
arXiv ID 2605.13467
相关性评分 9/10 (高度相关)