摘要
具有可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的标准后训练方法。现有基于组的策略梯度方法隐式定义了响应单纯形上的目标分布。本文提出列表式策略优化(LPO),通过限制近端 RL 目标并执行精确散度最小化,显式进行目标投影。该框架在保证单调改进、优化稳定性及响应多样性的同时,在多种推理任务和模型骨干上均优于传统基线。
AI 推荐理由
论文提出 LPO 方法,旨在通过优化策略提升 LLM 在可验证奖励任务中的推理能力。
研究机构
Department of Automation, Tsinghua University
LLM Department, Tencent
论文信息