摘要
在策略蒸馏(OPD)成为主流训练范式的背景下,本文探讨了同模型自蒸馏(OPSD)中因特权信息导致的严重信息泄露与长期训练不稳定问题。为此,作者提出 RLSD 方法,利用自蒸馏获取令牌级策略差异以确定细粒度更新幅度,同时保留基于环境反馈的 RLVR 来确定可靠更新方向。该方法融合了两者优势,显著提升了收敛上限与训练稳定性,实现了更高效的自我进化。
AI 推荐理由
论文提出自蒸馏结合 RLVR 实现模型自我进化,解决信息泄露与训练不稳定问题。
研究机构
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China
JD.COM
论文信息