摘要
基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的标准方法。然而,现有 PPO 式信任域机制对所有令牌强制执行均匀阈值,忽略了自回归生成的不对称性及前缀累积漂移问题。为此,本文提出累积前缀发散策略优化(CPPO),通过位置加权阈值和累积前缀预算两种耦合机制,动态调整令牌级更新限制。实验表明,CPPO 增强了训练稳定性,并在多种模型规模上显著提高了推理准确性。
AI 推荐理由
论文提出 CPPO 方法优化 RLVR 训练,显著提升 LLM 推理准确率,核心聚焦推理能力增强。
研究机构
Tencent Hunyuan
论文信息