摘要
内策略蒸馏(OPD)是大语言模型高效后训练的关键技术,广泛应用于智能体学习与模型压缩。然而,当师生分布差异较大时,OPD 训练易失稳。本文提出信任域内策略蒸馏(TrOPD),通过信用分配策略实现可靠的 token 级监督。该方法仅在教师提供可靠监督的区域执行 OPD,并利用异常值估计与离策略引导减轻不可靠监督的负面影响。实验表明,TrOPD 在数学推理、代码生成等任务上均优于现有最先进基线。
AI 推荐理由
提出 TrOPD 方法解决大模型后训练中的分布不匹配问题,显著提升 Agent 自我进化与策略优化稳定性。
研究机构
Samsung Research, Beijing, China
University of Oxford
Peking University
论文信息