self-distillation LLM adaptation self-improvement
摘要

自蒸馏(SD)为无需更强外部教师即可适配大型语言模型(LLM)提供了可行路径,但在自回归 LLM 中仍面临挑战。本文提出 UniSD,一个用于系统研究自蒸馏的统一框架。该框架整合了多种互补机制,包括多教师一致性、EMA 教师稳定化、令牌级对比学习、特征匹配和散度裁剪,以解决监督可靠性、表示对齐和训练稳定性问题。在六个基准和三个模型家族的六个模型上的实验表明,UniSD 能有效提升性能,优于静态模仿方法及最强基线,证实自蒸馏是高效且可控的 LLM 自适应方法。

AI 推荐理由

论文提出统一自蒸馏框架,实现无外部教师下的模型自我改进与适应,属核心自我进化研究。

研究机构
Georgia Institute of Technology University of California, Los Angeles Carnegie Mellon University
论文信息
作者 Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo et al.
发布日期 2026-05-07
arXiv ID 2605.06597
相关性评分 9/10 (高度相关)