策略蒸馏 推理优化 自适应训练 计算效率
摘要

策略蒸馏(OPD)通过在学生生成的轨迹上利用教师反馈来迁移推理行为,但标准的全程滚动训练成本高且低效。本文提出 ADWIN,一种自适应窗口框架,将滚动长度视为在线决策。该方法仅在短的教师锚定前缀上进行训练,并利用延迟的全程滚动探测来审计对齐情况,动态调整后续视野。在数学和代码推理基准测试中,ADWIN 显著改善了准确率与计算成本的权衡,端到端训练成本降低高达 4.1 倍,同时保持或提升了准确性。

AI 推荐理由

论文核心在于优化策略蒸馏以提升数学与代码推理能力,直接针对推理行为的迁移效率。

研究机构
School of Computer Science, Peking University National Key Laboratory for Multimedia Information Processing, Peking University LLM Department, Tencent
论文信息
作者 Kun Liang, Chenming Tang, Clive Bai, Weijie Liu, Saiyong Yang et al.
发布日期 2026-05-27
arXiv ID 2605.28396
相关性评分 9/10 (高度相关)