Self-Distillation Robust Reasoning Token Selection Distribution Alignment
摘要

自蒸馏通过重写参考答案为训练数据来提升学习效率,但易引入风格偏差,导致模型模仿表面形式而非学习有效推理模式。本文观察到重写数据中包含大量高困惑度令牌,源于有益的逻辑修正与有害的风格漂移。为此,提出分布对齐自蒸馏(DASD)方法,利用答案感知参考模型生成候选令牌,并依据基座模型置信度动态过滤。该方法在保留有用逻辑知识的同时抑制风格噪声。实验表明,DASD 在数学、代码及常识推理基准上均优于基线,显著降低高困惑度令牌比例,提升了不同难度任务下的推理鲁棒性。

AI 推荐理由

论文核心解决数学、代码及常识推理任务中的鲁棒性问题,提出动态令牌选择机制以优化推理模式学习。

研究机构
北京先进创新中心未来区块链与隐私计算,北京邮电大学 北京邮电大学人工智能学院
论文信息
作者 Ruiqi Zhang, Lingxiang Wang, Hainan Zhang Zhiming Zheng
发布日期 2026-05-30
arXiv ID 2606.00628
相关性评分 9/10 (高度相关)