摘要
可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但其稀疏的结果导向奖励引发了根本性的信用分配难题。本文通过奖励极性与 Token 熵的联合视角分析该问题,提出“四象限分解”诊断工具,发现推理提升集中于高熵区域。理论证明 Token 承载的信用上限由其熵决定。基于此,作者提出熵感知策略优化(EAPO)方法,通过调节 Token 级学习信号,在多个模型家族上优于强基线。
AI 推荐理由
论文核心解决 RLVR 中的信用分配问题,旨在显著提升 LLM 的推理能力。
研究机构
香港大学科技学院(广州)
华为技术有限公司
论文信息