摘要
组相对策略优化(GRPO)虽有效但依赖单一统计基线,抹去了轨迹空间中的细粒度偏好信息。为此,本文提出 Lambda 策略优化(LambdaPO),将优势估计重构为分解的成对偏好结构,通过动态衰减的奖励差分积分挖掘更精细的优化信号。此外,引入基于生成推理迹线与真值对齐的语义密度奖励以缓解监督稀疏性。实验表明,该方法在数学推理和问答任务上显著优于基线,引导大语言模型达到更优解。
AI 推荐理由
论文提出 LambdaPO 优化推理模型,通过细粒度偏好结构提升数学与逻辑推理性能,属核心研究。
研究机构
Pinterest, San Francisco, CA 94107, USA
论文信息