摘要
当前可验证设置下的后训练方法主要依赖强化学习(稀疏二元奖励)或蒸馏(需外部教师)。本文提出 Self-Distillation Zero (SD-Zero),无需外部教师或高质量演示,仅利用二元奖励训练单一模型扮演生成者与修正者双重角色。通过将修正者的输出蒸馏回生成者,该方法将二元奖励转化为密集的令牌级自监督信号。实验表明,在数学与代码推理任务中,SD-Zero 显著优于现有基线,并展现出令牌级自定位与迭代自我进化的新颖特性。
AI 推荐理由
论文提出自我蒸馏方法,通过自我修正将稀疏奖励转化为密集监督,实现模型的迭代自我进化。
研究机构
Princeton University
University of Toronto
Carnegie Mellon University
论文信息