摘要
可验证奖励的强化学习(RLVR)极大提升了大语言模型的推理能力,但其优化动态仍显脆弱。标准算法如 GRPO 通过“硬裁剪”强制稳定,却因丢弃信任域外令牌梯度而抑制探索。近期“软裁剪”方法虽试图恢复这些梯度,但依赖对数概率梯度会导致概率趋零时权重发散, destabilizing 训练。本文重构该范式,确立概率梯度为更优优化原语,并提出解耦梯度策略优化(DGPO)。该方法基于重要性采样比率采用解耦衰减机制,通过对边界令牌施加非对称连续衰减,解决了稳定性与持续探索间的冲突。在 DeepSeek-R1-Distill-Qwen 系列模型上的实验表明,DGPO 在多项数学基准上持续优于强基线,为 RLVR 提供了稳健可扩展的解决方案。
AI 推荐理由
论文提出 DGPO 算法优化 RLVR 训练稳定性,显著提升 LLM 在数学基准上的推理能力。
研究机构
厦门大学
清华大学
北京大学
论文信息