Small Language Models Reasoning Enhancement Distillation Token Selection
摘要

小语言模型(SLM)虽具计算效率,但推理能力常逊于大模型(LLM)。现有方法依赖 LLM 介入生成令牌,导致高延迟与成本;而标准蒸馏受限于 SLM 容量。本文发现“局部充分性”现象:在推理分歧点,LLM 首选令牌常位于 SLM 的前 K 个预测中。据此提出 SELECT TO THINK (S2T) 框架,将 LLM 角色从生成转为对 SLM 候选项的选择排序,并进一步推出 S2T-LOCAL,将选择逻辑蒸馏至 SLM 实现自主重排序。实验表明,1.5B SLM 的前 8 候选项以 95% 命中率覆盖 32B LLM 的选择,显著提升推理性能。

AI 推荐理由

论文核心解决小模型推理能力不足问题,提出新机制提升其逻辑推理表现。

研究机构
TUM School of Computation, Information and Technology, Technical University of Munich Hewlett Packard Enterprise (HPE) Research Center Huawei Technologies Duesseldorf GmbH Technical University of Munich
论文信息
作者 Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma
发布日期 2026-04-29
arXiv ID 2604.26940
相关性评分 9/10 (高度相关)