On-Policy Distillation Complex Reasoning Hindsight Bias LLM Training
摘要

同策略蒸馏(OPD)通过对齐学生模型与其自身轨迹上的教师预测分布,增强了大语言模型的复杂推理能力。特权 OPD 利用包含预言机轨迹等特权信息的自教师模型进一步强化该范式。然而,现有方法将特权信息视为单一模仿目标,未能解耦局部可达的推理步骤与未来条件的预言信号,导致学生模型产生后视偏差并跳过有效的中间推理。为此,本文提出锚定残差同策略蒸馏(AR-OPD),通过部分特权教师建立局部兼容锚点,并将预言前瞻作为受控残差注入。实验表明,该方法在多种推理任务中显著优于基线,有效减少后视泄露并提升长程轨迹性能。

AI 推荐理由

论文核心解决复杂推理中的后视偏差问题,提出新蒸馏框架显著提升长程推理能力。

研究机构
华南理工大学
论文信息
作者 Wenhao Zhang
发布日期 2026-06-09
arXiv ID 2606.10385
相关性评分 9/10 (高度相关)