On-Policy Distillation Reasoning Optimization Trial-and-Error Learning LLM Post-training
摘要

大语言模型后训练常依赖稀疏验证奖励,缺乏对推理成败细节的指导。现有在线策略蒸馏方法独立处理每次采样,忽略了同提示词下的其他尝试。本文提出多轮次在线策略蒸馏(MOPD),利用学生生成的局部轮次组构建更丰富的教师信号。该方法同时条件化成功与失败的同伴轨迹:成功提供有效推理模式的正向证据,失败则提供需避免的错误结构化负向证据。实验表明,MOPD 在竞争性编程、数学推理等基准上显著优于基线,证明利用多轮次试错行为能实现更精准的实例自适应监督。

AI 推荐理由

论文核心在于利用多轮次成败反馈优化推理轨迹,显著提升数学与编程推理能力。

研究机构
Carnegie Mellon University Microsoft Purdue University
论文信息
作者 Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang et al.
发布日期 2026-05-12
arXiv ID 2605.12652
相关性评分 9/10 (高度相关)