On-Policy Distillation Reasoning Efficiency Token Analysis Model Alignment
摘要

本文研究了策略蒸馏(OPD)中高损失令牌的现象,发现即使训练收敛,仍有大量“岩石令牌”保持高损失且阻碍学生模型修正。因果干预显示这些令牌对实际推理性能贡献微乎其微,却消耗了大量优化资源。研究表明,战略性绕过这些无效令牌可显著简化对齐过程,挑战了均匀令牌权重的必要性,为大模型蒸馏提供了更高效的范式。

AI 推荐理由

论文聚焦于蒸馏过程中对模型推理能力无贡献的令牌,直接关联推理效率与机制优化。

研究机构
University of Maryland, Baltimore County Caece Western Reserve University Arizona State University
论文信息
作者 Yuxuan Jiang, Runchao Li, Shubhashis Roy Dipta, Dawei Li, Zhao Yang
发布日期 2026-05-10
arXiv ID 2605.09253
相关性评分 8/10 (高度相关)