摘要
可验证奖励的强化学习(RLVR)是提升大语言模型推理能力的有效后训练范式,但现有方法常因小样本滚动导致的点估计方差高、方差坍塌及响应利用低效而面临样本效率低下问题。本文从统计估计视角重构 RLVR,将优势计算转化为有限数据下的奖励分布估计问题,并提出折扣 Beta-Bernoulli(DBB)奖励估计方法。该方法利用历史奖励统计量处理非平稳分布,虽存在偏差,但显著降低并稳定了方差,理论上避免了方差坍塌,且均方误差优于标准点估计。在六个分布内和三个分布外推理基准上的实验表明,结合 DBB 的 GRPO 方法在无额外计算或内存开销下,显著提升了模型的推理准确率。
AI 推荐理由
论文核心旨在通过改进 RLVR 算法提升 LLM 的推理能力,实验均围绕推理基准展开。
研究机构
韩国科学技术院 (KAIST), 首尔
论文信息