Context Distillation Reasoning Optimization Weight Interpolation LoRA
摘要

大型语言模型常通过生成推理轨迹来提升困难任务表现,但这增加了延迟与成本。本文提出 ThinkSwitch,一种低计算量的协同训练流程,旨在配对训练指令模型与思维模型。该方法利用思维模型生成答案并去除推理痕迹,通过 QLoRA 将纯答案数据蒸馏至指令模型,再利用球面权重插值重构思维模型。实验表明,仅需少量提示词,该方法即可显著提升模型在 AIME 数学题及 PubMedQA 医学问答上的推理准确率,证明了 targeted 蒸馏循环能将显式推理的优势部分迁移至模型权重中。

AI 推荐理由

论文核心研究通过蒸馏将推理能力内化至权重,直接提升特定任务的推理性能。

研究机构
Bellevue High School DigitalOcean
论文信息
作者 Dhruv Saini, Rohan Pandey
发布日期 2026-05-31
arXiv ID 2606.01080
相关性评分 9/10 (高度相关)