策略蒸馏 推理模型 梯度对齐 自我蒸馏
摘要

策略蒸馏为推理模型训练提供了密集的逐 token 监督信号,但其利弊条件尚不明确。本文提出一种无需训练的診斷框架,在逐 token、逐问题及逐教师模型的最高分辨率下进行分析。通过定义理想逐节点梯度并开发可扩展的目标滚动算法来估计该梯度,引入梯度对齐分数量化蒸馏信号的质量。研究发现,蒸馏指导在学生错误的滚动中与理想信号对齐度更高,而在正确滚动中则趋于噪声化。此外,最优蒸馏上下文取决于学生模型能力与目标任务,不存在通用配置。

AI 推荐理由

论文聚焦推理模型训练中的策略蒸馏机制,深入分析其对推理能力的提升与损害。

研究机构
Apple
论文信息
作者 Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang et al.
发布日期 2026-05-11
arXiv ID 2605.10889
相关性评分 9/10 (高度相关)