摘要
具有可验证奖励的强化学习有助于提升推理能力,但 GRPO 类方法在处理所有采样轨迹均失败的困难提示时容易停滞。SORT 方法在不改变轨迹生成的前提下,针对此类失败引入修复更新:它从参考解中推导计划,对比有无该计划条件下的 token 概率,并对在计划条件下更可预测的 token 赋予更高权重。这将全错提示转化为选择性、结构感知的学习信号,而非均匀模仿。在三个骨干模型和八个推理基准上的实验表明,SORT 优于 GRPO 及引导基线,且在较弱模型上增益最大。
AI 推荐理由
论文核心解决硬提示下的推理失败问题,利用计划引导优化强化学习信号,显著提升推理基准表现。
研究机构
Independent Author
Hanoi University of Science and Technology
University of Oregon
Department of Data Science and AI
Monash University
论文信息