摘要
策略蒸馏(OPD)通过在学生生成的轨迹上利用教师反馈来迁移推理行为,但标准的全程滚动训练成本高且低效。本文提出 ADWIN,一种自适应窗口框架,将滚动长度视为在线决策。该方法仅在短的教师锚定前缀上进行训练,并利用延迟的全程滚动探测来审计对齐情况,动态调整后续视野。在数学和代码推理基准测试中,ADWIN 显著改善了准确率与计算成本的权衡,端到端训练成本降低高达 4.1 倍,同时保持或提升了准确性。
AI 推荐理由
论文核心在于优化策略蒸馏以提升数学与代码推理能力,直接针对推理行为的迁移效率。
研究机构
School of Computer Science, Peking University
National Key Laboratory for Multimedia Information Processing, Peking University
LLM Department, Tencent
论文信息