摘要
同策略蒸馏(OPD)已成为大语言模型后训练的主流范式,尤其在推理领域,但因单样本蒙特卡洛估计器梯度方差高而训练不稳定。本文提出 vOPD,将 OPD 视为策略梯度强化学习,引入控制变量基线(即值函数)以降低方差。该值函数具有闭式解,为学生与教师模型间每 token 的负反向 KL 散度,无需额外批评家或推理。实验表明,vOPD 在数学和科学推理基准上优于原始 OPD,且性能媲美高开销的全词汇基线,实现了高效的稳定性提升。
AI 推荐理由
论文提出稳定蒸馏方法,显著提升模型在数学与科学推理任务上的表现,属关键支撑技术。
研究机构
Graduate School of Data Science, Seoul National University
论文信息