Large Reasoning Models Offline Distillation Mathematical Reasoning Post-training
摘要

同策略蒸馏(OPD)是大语言模型高效后训练的新范式,但标准方法需实时教师服务器,基础设施开销巨大。本文探究离线 OPD 可行性,发现“教师一致性”是关键条件,违反该条件会导致梯度偏差及次优收敛。据此提出 Lightning OPD 框架,通过在 SFT rollout 上预计算教师概率并强制教师一致性,完全消除对实时服务器的需求。理论证明其与标准 OPD 具有相同最优解且能防止策略漂移。数学推理与代码生成实验表明,该方法在大幅降低成本的同时达到了最先进水平。

AI 推荐理由

论文提出高效后训练框架,显著提升大模型在数学推理等任务上的性能,核心聚焦推理能力优化。

研究机构
NVIDIA
论文信息
作者 Yecheng Wu, Song Han, Hai Cai
发布日期 2026-04-14
arXiv ID 2604.13010
相关性评分 9/10 (高度相关)