self-distillation credit assignment reasoning contrastive learning
摘要

策略内自蒸馏通过后训练使模型利用环境反馈作为自身教师,无需外部标注即可提供稠密奖励。然而,该奖励的具体含义及归因机制尚不明确。本文证明该奖励实质上是响应与反馈间的点互信息(pMI),但其可能由特定输入推理或通用捷径提升。为此,作者提出 CREDIT 方法,通过批次对比基线隔离特定输入成分,惩罚在不相关输入下仍高概率的响应。实验表明,该方法在编码、科学推理及工具使用基准上均取得最优聚合性能。

AI 推荐理由

论文提出方法以区分通用捷径与特定输入推理,显著提升科学推理等基准表现。

研究机构
Xiaohongshu Inc. Institute of Automation, Chinese Academy of Sciences
论文信息
作者 Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li et al.
发布日期 2026-05-12
arXiv ID 2605.11613
相关性评分 8/10 (高度相关)