RLVR Entropy Calibration Mathematical Reasoning Exploration Strategy
摘要

可验证奖励强化学习(RLVR)虽能提升大语言模型推理能力,但常因策略熵快速坍缩而局限于狭窄的高概率推理路径。针对全局熵正则化在长推理轨迹中效率低下的问题,本文提出位置感知熵校准(PAEC)。该框架利用局部 top-p 熵和双候选竞争构建软掩码,并施加基于锚点的下界惩罚,以防止关键位置的熵坍缩。在五个数学推理基准上的实验表明,PAEC 显著优于强基线,尤其在 AIME 类任务中表现突出,证实了推理强化学习中选择性探索分配的重要性。

AI 推荐理由

论文核心解决 RLVR 中推理路径熵坍缩问题,通过位置感知熵校准提升数学推理能力。

研究机构
Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences School of Computer Science and Technology, University of Chinese Academy of Sciences Institute of Computing Technology, Chinese Academy of Sciences
论文信息
作者 Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li
发布日期 2026-06-07
arXiv ID 2606.08543
相关性评分 9/10 (高度相关)