摘要
自蒸馏通过重写参考答案为训练数据来提升学习效率,但易引入风格偏差,导致模型模仿表面形式而非学习有效推理模式。本文观察到重写数据中包含大量高困惑度令牌,源于有益的逻辑修正与有害的风格漂移。为此,提出分布对齐自蒸馏(DASD)方法,利用答案感知参考模型生成候选令牌,并依据基座模型置信度动态过滤。该方法在保留有用逻辑知识的同时抑制风格噪声。实验表明,DASD 在数学、代码及常识推理基准上均优于基线,显著降低高困惑度令牌比例,提升了不同难度任务下的推理鲁棒性。
AI 推荐理由
论文核心解决数学、代码及常识推理任务中的鲁棒性问题,提出动态令牌选择机制以优化推理模式学习。
研究机构
北京先进创新中心未来区块链与隐私计算,北京邮电大学
北京邮电大学人工智能学院
论文信息