摘要
针对推理模型生成的长思维链轨迹导致蒸馏成本高及学生模型输出冗长的问题,本文研究了蒸馏前的轨迹后处理压缩方法。利用两个教师模型生成大量正确轨迹,并通过指令微调模型将其压缩至原长度的 8.6%-21.0%。实验表明,压缩轨迹显著减少了训练 token 消耗,加速了训练过程并缩短了推理输出。虽然原始轨迹仍保持最高准确率,但压缩轨迹在较小规模学生模型上实现了精度与效率的良好权衡,每 token 效率提升高达 18 倍,且优于简单的截断策略。
AI 推荐理由
论文核心研究推理轨迹的压缩与蒸馏,直接优化思维链效率与成本。
研究机构
Université catholique de Louvain
Sophont Inc.
论文信息