Self-Distillation Model Evolution Reinforcement Learning Math Reasoning Code Generation
摘要

自蒸馏使语言模型能利用自身轨迹进行在线学习,其中教师模型拥有学生模型推理时不可见的特权信息。然而,这导致了信息不对称且最佳信息类型依赖任务。本文提出自适应视图自蒸馏(AVSD),通过分离跨视图的稳定共识与特定视图的残差信号来重构令牌级监督。AVSD 识别共享共识以提供可靠更新方向,并仅在残差信号与共识对齐且比例适当时选择性添加。在数学竞赛及代码生成基准测试中,AVSD 显著优于单视图自蒸馏基线及 GRPO 方法。

AI 推荐理由

提出自适应视图自蒸馏方法,通过多视角信号平衡实现模型自我改进与策略优化,属核心进化机制。

研究机构
UNC Chapel Hill Capital One The University of Texas at Austin
论文信息
作者 Duy Nguyen, Hanqi Xiao, Archiki Prasad, Zaid Khan, Anirban Das et al.
发布日期 2026-05-20
arXiv ID 2605.20643
相关性评分 9/10 (高度相关)