Self-Distillation Math Reasoning RLVR Token-Routed Alignment
摘要

本文针对全令牌自蒸馏在长程数学训练中导致的冗余梯度消耗及分布外性能退化问题,提出了 TRACE 方法。该方法仅在标注的关键推理跨度上进行蒸馏:对正确轨迹的关键部分使用前向 KL 散度,对局部错误部分可选使用反向 KL 散度,其余令牌采用 GRPO 算法。实验表明,TRACE 在多个数学基准上显著优于基线,有效保留了模型的分布外泛化能力,并证实了在线自我标注下的增益持续性,解决了特权信息泄露导致的推理缩短问题。

AI 推荐理由

论文核心针对长程数学推理中的退化问题,提出关键推理跨度对齐方法。

研究机构
国家软件科学与技术重点实验室,南京大学 南京大学智能科学与技术学院 AMAR, 阿里集团 威斯康星大学麦迪逊分校 清华大学
论文信息
作者 Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen, Yulan Hu, Zheng Pan et al.
发布日期 2026-05-11
arXiv ID 2605.10194
相关性评分 9/10 (高度相关)