Self-Distillation Self-Evolution Reinforcement Learning Sample Efficiency
摘要

当前可验证设置下的后训练方法主要依赖强化学习(稀疏二元奖励)或蒸馏(需外部教师)。本文提出 Self-Distillation Zero (SD-Zero),无需外部教师或高质量演示,仅利用二元奖励训练单一模型扮演生成者与修正者双重角色。通过将修正者的输出蒸馏回生成者,该方法将二元奖励转化为密集的令牌级自监督信号。实验表明,在数学与代码推理任务中,SD-Zero 显著优于现有基线,并展现出令牌级自定位与迭代自我进化的新颖特性。

AI 推荐理由

论文提出自我蒸馏方法,通过自我修正将稀疏奖励转化为密集监督,实现模型的迭代自我进化。

研究机构
Princeton University University of Toronto Carnegie Mellon University
论文信息
作者 Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu et al.
发布日期 2026-04-13
arXiv ID 2604.12002
相关性评分 9/10 (高度相关)