RLVR 策略优化 推理增强 几何解释
摘要

具有可验证奖励的强化学习(RLVR)已成为提升大语言模型推理能力的标准后训练方法。现有基于组的策略梯度方法隐式定义了响应单纯形上的目标分布。本文提出列表式策略优化(LPO),通过限制近端 RL 目标并执行精确散度最小化,显式进行目标投影。该框架在保证单调改进、优化稳定性及响应多样性的同时,在多种推理任务和模型骨干上均优于传统基线。

AI 推荐理由

论文提出 LPO 方法,旨在通过优化策略提升 LLM 在可验证奖励任务中的推理能力。

研究机构
Department of Automation, Tsinghua University LLM Department, Tencent
论文信息
作者 Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang et al.
发布日期 2026-05-07
arXiv ID 2605.06139
相关性评分 9/10 (高度相关)