摘要
可验证奖励强化学习(RLVR)对提升大语言模型推理能力至关重要。然而,广泛使用的 PPO 代理目标本质上是局部的,引入了结构偏差。本文提出$N$步前向轨迹,利用后续$N-1$个 token 的累积似然比增强 PPO 目标,并据此提出 NFPO 算法。该方法在代理目标与精确策略梯度间构建连续桥梁, principled 地控制偏差 - 方差权衡。理论分析表明其能提供更紧的策略改进界,综合推理基准实验证实了 NFPO 的性能提升。
AI 推荐理由
论文核心旨在通过改进 RL 算法提升 LLM 的推理能力,并在推理基准上验证。
研究机构
Seoul National University
论文信息