Reinforcement Learning Self-Distillation Agent Evolution LLM Post-training
摘要

强化学习(RL)已成为大语言模型代理后训练的核心范式,但其轨迹级奖励信号对长程交互仅提供粗略监督。在线策略自蒸馏(OPSD)虽能通过特权上下文提供密集 token 级指导,但在多轮代理中易引发不稳定性。本文提出自蒸馏代理强化学习(SDAR),将 OPSD 作为门控辅助目标,以 RL 为主要优化骨干。SDAR 利用 Sigmoid 门控映射 token 级信号,增强教师认可的正向差距 token 的蒸馏,并柔和衰减负向拒绝。实验表明,SDAR 在多个基准上显著优于 GRPO 及混合基线,且避免了不稳定性。

AI 推荐理由

论文提出 SDAR 框架,通过自蒸馏与强化学习结合实现 Agent 自我改进,核心聚焦自我进化机制。

研究机构
浙江大学 梅尔顿
论文信息
作者 Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu et al.
发布日期 2026-05-14
arXiv ID 2605.15155
相关性评分 9/10 (高度相关)