摘要
本文研究了策略蒸馏(OPD)中高损失令牌的现象,发现即使训练收敛,仍有大量“岩石令牌”保持高损失且阻碍学生模型修正。因果干预显示这些令牌对实际推理性能贡献微乎其微,却消耗了大量优化资源。研究表明,战略性绕过这些无效令牌可显著简化对齐过程,挑战了均匀令牌权重的必要性,为大模型蒸馏提供了更高效的范式。
AI 推荐理由
论文聚焦于蒸馏过程中对模型推理能力无贡献的令牌,直接关联推理效率与机制优化。
研究机构
University of Maryland, Baltimore County
Caece Western Reserve University
Arizona State University
论文信息