self-distillation LLM reasoning entropy guidance efficient training
摘要

在线策略自蒸馏利用教师模型提供的密集 token 级监督训练推理模型。现有目标通常均匀加权思维链序列中的信号,忽略了预测分布熵的显著变化。本文提出熵引导强化自蒸馏(EGRSD),通过奖励导向方向、师生似然比幅度及提出的教师熵置信门控统一 token 级更新,后者在降低高熵位置权重的同时保持非零下界。此外,引入因果前瞻变体 CL-EGRSD 以区分持续高熵跨度与瞬态高熵位置。实验表明,该方法在准确率与长度权衡上优于现有可训练方法。

AI 推荐理由

论文核心提出新蒸馏方法以优化 LLM 推理效率与准确性,直接针对推理能力。

研究机构
上海交通大学 清华大学 上海人工智能实验室
论文信息
作者 Junlong Ke, Zichen Wen, Weijia Li, Conghui He, Linfeng Zhang
发布日期 2026-05-13
arXiv ID 2605.13255
相关性评分 9/10 (高度相关)