知识蒸馏 强化学习 推理增强 梯度方差降低
摘要

同策略蒸馏(OPD)已成为大语言模型后训练的主流范式,尤其在推理领域,但因单样本蒙特卡洛估计器梯度方差高而训练不稳定。本文提出 vOPD,将 OPD 视为策略梯度强化学习,引入控制变量基线(即值函数)以降低方差。该值函数具有闭式解,为学生与教师模型间每 token 的负反向 KL 散度,无需额外批评家或推理。实验表明,vOPD 在数学和科学推理基准上优于原始 OPD,且性能媲美高开销的全词汇基线,实现了高效的稳定性提升。

AI 推荐理由

论文提出稳定蒸馏方法,显著提升模型在数学与科学推理任务上的表现,属关键支撑技术。

研究机构
Graduate School of Data Science, Seoul National University
论文信息
作者 Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo
发布日期 2026-05-08
arXiv ID 2605.07865
相关性评分 8/10 (高度相关)