Knowledge Distillation Mathematical Reasoning Distribution Shift Offline Learning
摘要

将强大型语言模型的推理轨迹蒸馏至小模型是提升资源受限场景智能的有效途径。现有方法面临权衡:离线蒸馏虽高效但存在分布漂移,导致推理误差累积;在线方法虽匹配分布却成本高昂且早期质量低。本文提出一种原则性离线推理蒸馏框架,在保留离线数据效率与质量的同时,通过自适应强调与学生策略分布对齐的教师监督来校正分布漂移。在 GSM8K、MATH 及奥数竞赛等基准上的评估表明,该方法显著提升了推理准确性与轨迹稳定性,无需在线采样即可强化离线蒸馏效果。

AI 推荐理由

论文核心解决离线蒸馏中的分布漂移问题,旨在显著提升小模型的数学推理能力与轨迹稳定性。

研究机构
George Mason University, Fairfax, VA, USA
论文信息
作者 Yumeng Zhang, Zhengbang Yang, Yevin Nikhel Goonatilake, Zhuangdi Zhu
发布日期 2026-05-13
arXiv ID 2605.14071
相关性评分 9/10 (高度相关)