摘要
在线策略自蒸馏利用教师模型提供的密集 token 级监督训练推理模型。现有目标通常均匀加权思维链序列中的信号,忽略了预测分布熵的显著变化。本文提出熵引导强化自蒸馏(EGRSD),通过奖励导向方向、师生似然比幅度及提出的教师熵置信门控统一 token 级更新,后者在降低高熵位置权重的同时保持非零下界。此外,引入因果前瞻变体 CL-EGRSD 以区分持续高熵跨度与瞬态高熵位置。实验表明,该方法在准确率与长度权衡上优于现有可训练方法。
AI 推荐理由
论文核心提出新蒸馏方法以优化 LLM 推理效率与准确性,直接针对推理能力。
研究机构
上海交通大学
清华大学
上海人工智能实验室
论文信息