Reinforcement Learning Mathematical Reasoning GRPO LLM Alignment
摘要

群组相对策略优化(GRPO)在对齐语言模型推理任务上表现有效,但其对称处理所有 token 位置和采样轨迹。本文提出两种互补扩展:自适应视界 GRPO(AH-GRPO),利用基于累积熵的折扣加权 token 策略梯度,在模型不确定时缩短有效视界;选择性优势 AH-GRPO(SA-AH-GRPO),仅对负优势轨迹应用折扣,保留正优势轨迹完整信号。在 GSM8K 数学推理基准上的实验表明,该方法显著降低训练方差并提升通过率,为结构化生成任务的强化学习提供了原则性归纳偏置。

AI 推荐理由

论文提出改进的 GRPO 算法,专门针对数学推理任务优化,显著提升推理准确率与训练稳定性。

研究机构
Indian Institute of Technology (BHU), Varanasi, India Department of Computer Science, University of Illinois Chicago, IL 60607, USA
论文信息
作者 Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya
发布日期 2026-06-03
arXiv ID 2606.05434
相关性评分 9/10 (高度相关)