GRPO 强化学习 推理增强 训练稳定性
摘要

组相对策略优化(GRPO)是提升大语言模型推理能力的有效方法,但在训练中难以平衡探索与利用,导致性能次优。受令牌概率与对应优势间协方差控制熵变的理论启发,本文提出一种无超参数的协方差加权优化方法,通过高斯核动态降低极端令牌级更新的权重。该方法在保留有效学习信号的同时,自动减少了由探索 - 利用权衡引起的不稳定性。大量实证评估表明,相比 GRPO,该方法显著提升了多个推理基准的下游性能,并有效稳定了训练过程中的熵值。

AI 推荐理由

论文旨在提升 LLM 推理能力,提出改进 GRPO 算法以优化推理基准表现。

研究机构
National University of Singapore University of California, Davis University of Southern California
论文信息
作者 Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen
发布日期 2026-05-12
arXiv ID 2605.11538
相关性评分 9/10 (高度相关)