摘要
群组相对策略优化(GRPO)在对齐语言模型推理任务上表现有效,但其对称处理所有 token 位置和采样轨迹。本文提出两种互补扩展:自适应视界 GRPO(AH-GRPO),利用基于累积熵的折扣加权 token 策略梯度,在模型不确定时缩短有效视界;选择性优势 AH-GRPO(SA-AH-GRPO),仅对负优势轨迹应用折扣,保留正优势轨迹完整信号。在 GSM8K 数学推理基准上的实验表明,该方法显著降低训练方差并提升通过率,为结构化生成任务的强化学习提供了原则性归纳偏置。
AI 推荐理由
论文提出改进的 GRPO 算法,专门针对数学推理任务优化,显著提升推理准确率与训练稳定性。
研究机构
Indian Institute of Technology (BHU), Varanasi, India
Department of Computer Science, University of Illinois Chicago, IL 60607, USA
论文信息