self-distillation mathematical reasoning token reliability LLM training
摘要

在策略自蒸馏(OPSD)中,标准目标平等对待所有生成令牌,忽略了教师令牌在不同位置的可靠性差异。本文提出分支可行性诊断,发现序列内位置是预测教师令牌可靠性的最强指标。据此,作者提出了位置加权在策略自蒸馏(PW-OPSD),通过施加递增的位置权重来优化训练。实验表明,该方法在 AIME 2024/2025 及多个大模型上显著提升了数学推理性能,证明了推理蒸馏中教师令牌可靠性的轨迹结构化特征。

AI 推荐理由

论文核心研究推理任务中的自蒸馏机制,通过位置加权提升模型推理可靠性。

研究机构
约翰霍普金斯大学 威斯康星大学麦迪逊分校 南洋理工大学
论文信息
作者 Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao
发布日期 2026-05-20
arXiv ID 2605.21606
相关性评分 9/10 (高度相关)