self-distillation complex reasoning on-policy learning model internalization
摘要

推理时的辅助流程(harnesses)虽能提升大语言模型在复杂推理任务上的表现,但未改变模型内在能力。为此,本文提出同策略脚手架自蒸馏(OPHSD),利用增强后的当前模型作为教师进行自蒸馏,引入超越训练数据的额外监督信号。该方法将特定任务的辅助能力内化至学生模型,在文本分类和数学推理等多样任务中展现出强大的泛化性与独立性能。实验表明,训练后移除辅助流程不仅无害,反而证实了复杂流程可作为临时训练支架,将其效益永久反馈至基础模型。

AI 推荐理由

论文核心研究利用自蒸馏将推理辅助机制内化,显著提升模型在复杂推理任务上的独立能力。

研究机构
北京大学
论文信息
作者 Zhengyang Zhao, Lu Ma, Wentao Zhang
发布日期 2026-05-09
arXiv ID 2605.08741
相关性评分 9/10 (高度相关)