摘要
大型推理模型虽在复杂任务中表现优异,但将其长思维链轨迹迁移至小模型极具挑战。现有方法多依赖事后过滤,无法控制生成过程且可能产生超出学生能力的路径。为此,本文提出 Gen-SSD 框架,让学生在教师采样过程中实时评估候选续写,仅扩展可学习路径并提前剪枝无效分支。数学推理基准实验表明,该方法显著优于标准知识蒸馏及最新基线,生成了更稳定、可学习的推理轨迹,证实了生成过程中引入监督对有效蒸馏的重要性。
AI 推荐理由
论文核心研究通过蒸馏优化小模型的思维链推理能力,直接提升数学推理性能。
研究机构
清华大学
论文信息