摘要
强化学习可提升大语言模型推理能力,但传统 PPO/GRPO 方法因固定裁剪与解码温度导致训练脆弱且调参困难。本文提出自适应组策略优化(AGPO),一种无需评论家的 GRPO 改进版,利用组级统计量控制更新幅度与探索策略。AGPO 通过共享探针衍生的统计状态驱动两个控制器:一是基于奖励分散度、偏度及策略熵等指标的自适应裁剪;二是根据相对基线的中心化不确定性进行双向自适应温度采样。在九个中英文数学/STEM 基准测试中,AGPO 训练的 Qwen2.5-14B 表现优于同等 token 预算下的 PPO/GRPO,验证了模块的有效性与互补性。
AI 推荐理由
论文提出 AGPO 算法优化 RL 训练,显著提升 LLM 在数学和 STEM 基准上的推理能力。
研究机构
1
论文信息