RLVR Mathematical Reasoning Policy Optimization Gradient Stability
摘要

可验证奖励的强化学习(RLVR)极大提升了大语言模型的推理能力,但其优化动态仍显脆弱。标准算法如 GRPO 通过“硬裁剪”强制稳定,却因丢弃信任域外令牌梯度而抑制探索。近期“软裁剪”方法虽试图恢复这些梯度,但依赖对数概率梯度会导致概率趋零时权重发散, destabilizing 训练。本文重构该范式,确立概率梯度为更优优化原语,并提出解耦梯度策略优化(DGPO)。该方法基于重要性采样比率采用解耦衰减机制,通过对边界令牌施加非对称连续衰减,解决了稳定性与持续探索间的冲突。在 DeepSeek-R1-Distill-Qwen 系列模型上的实验表明,DGPO 在多项数学基准上持续优于强基线,为 RLVR 提供了稳健可扩展的解决方案。

AI 推荐理由

论文提出 DGPO 算法优化 RLVR 训练稳定性,显著提升 LLM 在数学基准上的推理能力。

研究机构
厦门大学 清华大学 北京大学
论文信息
作者 Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin et al.
发布日期 2026-03-15
arXiv ID 2603.14389
相关性评分 9/10 (高度相关)