On-Policy Distillation Multi-turn Agents Curriculum Learning Reasoning Transfer
摘要

策略内蒸馏(OPD)在将前沿模型的推理能力迁移至小型模型方面潜力巨大,但在多轮代理场景中的应用尚不充分。本文指出传统 OPD 存在“轨迹级 KL 散度不稳定”问题,即误差累积导致学生模型偏离教师分布,训练信号失效。为此,提出 TCOD 框架,采用时间课程策略,由短至长逐步增加轨迹深度。实验表明,TCOD 有效抑制了 KL 散度 escalation,显著提升了代理在多个基准测试中的性能,甚至超越教师模型。

AI 推荐理由

论文核心解决多轮交互中的推理能力蒸馏问题,通过课程学习稳定推理轨迹。

研究机构
Tongyi Lab, Alibaba Group
论文信息
作者 Jiaqi Wang, Wenhao Zhang, Weijie Shi, Yaliang Li, James Cheng
发布日期 2026-04-27
arXiv ID 2604.24005
相关性评分 9/10 (高度相关)