摘要
针对强化学习训练的大语言模型在数学推理中面临“悬崖”提示导致梯度消失的问题,本文提出混合蒸馏策略优化(HDPO)。该方法通过识别失败样本,利用地面真实信息生成特权轨迹,并将教师模型的令牌级分布蒸馏给学生模型。理论证明该方法能恢复最优策略。实验表明,HDPO 在保持贪婪准确率的同时,显著提升了覆盖率指标,有效平衡了探索与利用。
AI 推荐理由
论文核心解决数学推理中的梯度消失问题,通过新算法显著提升推理能力。
研究机构
NVIDIA
论文信息