Knowledge Distillation Reasoning Efficiency Token Reduction Small Language Models
摘要

以推理为中心的大语言模型虽性能强劲,但常伴随高昂的令牌消耗与推理成本。观察发现,大模型能生成更简洁的推理轨迹,而小模型往往冗余。为此,本文提出混合策略蒸馏(MPD)框架,将大模型的简洁推理行为迁移至小模型。该方法结合在线与离线蒸馏优势,利用教师模型重写学生采样的轨迹进行压缩,并通过 KL 散度对齐训练。实验表明,MPD 在减少高达 27.1% 令牌用量的同时,提升了多项推理基准的性能,实现了高效的小模型推理。

AI 推荐理由

论文核心研究推理轨迹压缩与蒸馏,直接优化 LLM 推理效率与性能。

研究机构
Technical University of Munich GESIS – Leibniz Institute for the Social Sciences Northeastern University LMU Munich Siemens AG University of Cambridge University of Oxford Mina AI
论文信息
作者 Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan et al.
发布日期 2026-05-09
arXiv ID 2605.08776
相关性评分 9/10 (高度相关)