Self-Distillation Reward Regularization Model Improvement
摘要

针对现有自蒸馏方法依赖固定教师模型导致训练不稳定及推理性能下降的问题,本文提出基于偏好的自蒸馏(PBSD)。该方法摒弃直接的 KL 散度匹配,转而采用奖励正则化视角,通过优化师生样本间的偏好差距,推导出优于原始教师的策略分布。理论分析确立了该场景下自蒸馏优于外部教师学习的条件。在数学推理与工具使用基准上的实验表明,PBSD 在保持令牌效率的同时,显著提升了训练稳定性并取得了最佳平均性能。

AI 推荐理由

提出基于偏好的自蒸馏方法,实现模型自我改进与性能提升,属自我进化核心研究。

研究机构
The Pennsylvania State University TikTok
论文信息
作者 Xin Yu, Liuchen Liao, Yiwen Zhang, Yingchen Yu, Lingzhou Xue et al.
发布日期 2026-05-06
arXiv ID 2605.05040
相关性评分 9/10 (高度相关)