摘要
自蒸馏(SD)为无需更强外部教师即可适配大型语言模型(LLM)提供了可行路径,但在自回归 LLM 中仍面临挑战。本文提出 UniSD,一个用于系统研究自蒸馏的统一框架。该框架整合了多种互补机制,包括多教师一致性、EMA 教师稳定化、令牌级对比学习、特征匹配和散度裁剪,以解决监督可靠性、表示对齐和训练稳定性问题。在六个基准和三个模型家族的六个模型上的实验表明,UniSD 能有效提升性能,优于静态模仿方法及最强基线,证实自蒸馏是高效且可控的 LLM 自适应方法。
AI 推荐理由
论文提出统一自蒸馏框架,实现无外部教师下的模型自我改进与适应,属核心自我进化研究。
研究机构
Georgia Institute of Technology
University of California, Los Angeles
Carnegie Mellon University
论文信息