Reinforcement Learning Reasoning Plan Guidance GRPO LLM Optimization
摘要

具有可验证奖励的强化学习有助于提升推理能力,但 GRPO 类方法在处理所有采样轨迹均失败的困难提示时容易停滞。SORT 方法在不改变轨迹生成的前提下,针对此类失败引入修复更新:它从参考解中推导计划,对比有无该计划条件下的 token 概率,并对在计划条件下更可预测的 token 赋予更高权重。这将全错提示转化为选择性、结构感知的学习信号,而非均匀模仿。在三个骨干模型和八个推理基准上的实验表明,SORT 优于 GRPO 及引导基线,且在较弱模型上增益最大。

AI 推荐理由

论文核心解决硬提示下的推理失败问题,利用计划引导优化强化学习信号,显著提升推理基准表现。

研究机构
Independent Author Hanoi University of Science and Technology University of Oregon Department of Data Science and AI Monash University
论文信息
作者 Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van, Trung Le
发布日期 2026-05-12
arXiv ID 2605.11505
相关性评分 9/10 (高度相关)