摘要
可验证奖励的强化学习(RLVR)显著提升了大语言模型的推理能力,但面临“受限探索”的根本局限,即策略迅速收敛至狭窄解集。针对现有熵正则化方法的不稳定性,本文提出重思策略熵与探索的关系,将熵分解为保留多样解路的“信息熵”和侵蚀推理模式的“虚假熵”。研究揭示有效探索需进行“熵细化”,即在正样本中维持信息熵而在负样本中抑制虚假熵。据此提出的 AsymGRPO 框架通过解耦正负滚动的熵调制,实现了 superior 的推理性能。
AI 推荐理由
论文核心解决 RLVR 中推理能力受限问题,提出熵细化机制以增强多样化解路径。
研究机构
北卡罗来纳州立大学
凯斯西储大学
论文信息