Small Language Models On-policy Distillation Tool-integrated Reasoning Agent Training
摘要

工具集成推理(TIR)因长程交互不稳定及模型容量受限,难以扩展至小型语言模型。现有在线策略蒸馏(OPD)方法在 TIR 应用中会导致错误工具调用级联,加剧师生模型分歧。为此,本文提出 SOD 框架,根据步骤级分歧自适应重加权蒸馏强度,在高分歧区域减弱误导性信号,同时在一致状态保留密集指导。实验表明,SOD 在数学、科学及代码基准上显著优于基线,证明了其向轻量级模型有效迁移智能体推理能力的潜力。

AI 推荐理由

论文核心解决小模型在工具集成推理中的错误级联问题,提出逐步蒸馏框架以提升推理能力。

研究机构
浙江大学 腾讯大模型部门 中国科学院大学 新加坡国立大学
论文信息
作者 Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun et al.
发布日期 2026-05-08
arXiv ID 2605.07725
相关性评分 9/10 (高度相关)