摘要
组相对策略优化(GRPO)是提升大语言模型推理能力的有效方法,但在训练中难以平衡探索与利用,导致性能次优。受令牌概率与对应优势间协方差控制熵变的理论启发,本文提出一种无超参数的协方差加权优化方法,通过高斯核动态降低极端令牌级更新的权重。该方法在保留有效学习信号的同时,自动减少了由探索 - 利用权衡引起的不稳定性。大量实证评估表明,相比 GRPO,该方法显著提升了多个推理基准的下游性能,并有效稳定了训练过程中的熵值。
AI 推荐理由
论文旨在提升 LLM 推理能力,提出改进 GRPO 算法以优化推理基准表现。
研究机构
National University of Singapore
University of California, Davis
University of Southern California
论文信息