mathematical reasoning reinforcement learning self-distillation LLM optimization
摘要

针对强化学习训练的大语言模型在数学推理中面临“悬崖”提示导致梯度消失的问题,本文提出混合蒸馏策略优化(HDPO)。该方法通过识别失败样本,利用地面真实信息生成特权轨迹,并将教师模型的令牌级分布蒸馏给学生模型。理论证明该方法能恢复最优策略。实验表明,HDPO 在保持贪婪准确率的同时,显著提升了覆盖率指标,有效平衡了探索与利用。

AI 推荐理由

论文核心解决数学推理中的梯度消失问题,通过新算法显著提升推理能力。

研究机构
NVIDIA
论文信息
作者 Ken Ding
发布日期 2026-03-25
arXiv ID 2603.23871
相关性评分 9/10 (高度相关)