GRPO 强化学习 数学推理 经验回放 样本效率
摘要

基于可验证奖励的强化学习(GRPO)是后训练推理大语言模型的标准方法,但存在样本效率低的问题。针对策略快速漂移导致传统回放失效的挑战,本文提出一种 Rollout 级回放缓冲机制。该方法通过年龄驱逐限制数据陈旧度,并利用新鲜锚定组合保持在线策略特性,同时依据优势幅度优先回放高价值样本。在五个数学基准上的实验表明,该方法显著优于 GRPO 及朴素回放基线,且在更大模型规模下增益更明显,有效提升了推理准确率与令牌效率。

AI 推荐理由

论文核心是通过改进 GRPO 算法提升 LLM 在数学基准上的推理能力,属于推理领域的核心优化。

研究机构
Department of Electrical and Computer Engineering, Seoul National University Interdisciplinary Program in AI, Seoul National University AIIS, ASRI, INMC, and ISRC, Seoul National University
论文信息
作者 Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon
发布日期 2026-06-03
arXiv ID 2606.04560
相关性评分 9/10 (高度相关)