摘要
以推理为中心的大语言模型虽性能强劲,但常伴随高昂的令牌消耗与推理成本。观察发现,大模型能生成更简洁的推理轨迹,而小模型往往冗余。为此,本文提出混合策略蒸馏(MPD)框架,将大模型的简洁推理行为迁移至小模型。该方法结合在线与离线蒸馏优势,利用教师模型重写学生采样的轨迹进行压缩,并通过 KL 散度对齐训练。实验表明,MPD 在减少高达 27.1% 令牌用量的同时,提升了多项推理基准的性能,实现了高效的小模型推理。
AI 推荐理由
论文核心研究推理轨迹压缩与蒸馏,直接优化 LLM 推理效率与性能。
研究机构
Technical University of Munich
GESIS – Leibniz Institute for the Social Sciences
Northeastern University
LMU Munich
Siemens AG
University of Cambridge
University of Oxford
Mina AI
论文信息