On-Policy Distillation LLM Post-training Trust Region Agent Evolution
摘要

内策略蒸馏(OPD)是大语言模型高效后训练的关键技术,广泛应用于智能体学习与模型压缩。然而,当师生分布差异较大时,OPD 训练易失稳。本文提出信任域内策略蒸馏(TrOPD),通过信用分配策略实现可靠的 token 级监督。该方法仅在教师提供可靠监督的区域执行 OPD,并利用异常值估计与离策略引导减轻不可靠监督的负面影响。实验表明,TrOPD 在数学推理、代码生成等任务上均优于现有最先进基线。

AI 推荐理由

提出 TrOPD 方法解决大模型后训练中的分布不匹配问题,显著提升 Agent 自我进化与策略优化稳定性。

研究机构
Samsung Research, Beijing, China University of Oxford Peking University
论文信息
作者 Xingrun Xing, Haoqing Wang, Boyan Gao, Ziheng Li, Yehui Tang
发布日期 2026-05-31
arXiv ID 2606.01249
相关性评分 9/10 (高度相关)