RLVR Credit Assignment Reasoning Entropy Analysis Policy Optimization
摘要

可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但其稀疏的结果导向奖励引发了根本性的信用分配难题。本文通过奖励极性与 Token 熵的联合视角分析该问题,提出“四象限分解”诊断工具,发现推理提升集中于高熵区域。理论证明 Token 承载的信用上限由其熵决定。基于此,作者提出熵感知策略优化(EAPO)方法,通过调节 Token 级学习信号,在多个模型家族上优于强基线。

AI 推荐理由

论文核心解决 RLVR 中的信用分配问题,旨在显著提升 LLM 的推理能力。

研究机构
香港大学科技学院(广州) 华为技术有限公司
论文信息
作者 Yuhang He, Haodong Wu, Siyi Liu, Hongyu Ge, Hange Zhou et al.
发布日期 2026-04-13
arXiv ID 2604.11056
相关性评分 9/10 (高度相关)