摘要
可验证奖励的强化学习(RLVR)虽提升了大语言模型的推理性能,但近期研究表明其未激发新的推理模式,反而导致训练模型的推理能力边界较基线模型收窄。为此,本文提出非对称组策略优化(AGPO)以抑制该边界收缩。AGPO 采用负向主导策略抑制错误推理路径,保持探索能力;正向强化则引入组优势机制,基于组内方差缩放更新,聚焦稀有正确路径。实验表明,AGPO 在五个数学基准上达到最先进水平,并在工业级搜索广告相关性优化中显著提升了数据标注质量及下游模型性能。
AI 推荐理由
论文核心提出 AGPO 算法,旨在解决 RLVR 中推理能力边界收缩问题,显著提升数学推理性能。
研究机构
Nanjing University, Nanjing, China
Beijing, China
DeepSeek
University of Technology Sydney, Australia
论文信息