摘要
策略内蒸馏(OPD)在将前沿模型的推理能力迁移至小型模型方面潜力巨大,但在多轮代理场景中的应用尚不充分。本文指出传统 OPD 存在“轨迹级 KL 散度不稳定”问题,即误差累积导致学生模型偏离教师分布,训练信号失效。为此,提出 TCOD 框架,采用时间课程策略,由短至长逐步增加轨迹深度。实验表明,TCOD 有效抑制了 KL 散度 escalation,显著提升了代理在多个基准测试中的性能,甚至超越教师模型。
AI 推荐理由
论文核心解决多轮交互中的推理能力蒸馏问题,通过课程学习稳定推理轨迹。
研究机构
Tongyi Lab, Alibaba Group
论文信息