摘要
大型语言模型常通过生成推理轨迹来提升困难任务表现,但这增加了延迟与成本。本文提出 ThinkSwitch,一种低计算量的协同训练流程,旨在配对训练指令模型与思维模型。该方法利用思维模型生成答案并去除推理痕迹,通过 QLoRA 将纯答案数据蒸馏至指令模型,再利用球面权重插值重构思维模型。实验表明,仅需少量提示词,该方法即可显著提升模型在 AIME 数学题及 PubMedQA 医学问答上的推理准确率,证明了 targeted 蒸馏循环能将显式推理的优势部分迁移至模型权重中。
AI 推荐理由
论文核心研究通过蒸馏将推理能力内化至权重,直接提升特定任务的推理性能。
研究机构
Bellevue High School
DigitalOcean
论文信息