摘要
强化学习(RL)已成为大语言模型代理后训练的核心范式,但其轨迹级奖励信号对长程交互仅提供粗略监督。在线策略自蒸馏(OPSD)虽能通过特权上下文提供密集 token 级指导,但在多轮代理中易引发不稳定性。本文提出自蒸馏代理强化学习(SDAR),将 OPSD 作为门控辅助目标,以 RL 为主要优化骨干。SDAR 利用 Sigmoid 门控映射 token 级信号,增强教师认可的正向差距 token 的蒸馏,并柔和衰减负向拒绝。实验表明,SDAR 在多个基准上显著优于 GRPO 及混合基线,且避免了不稳定性。
AI 推荐理由
论文提出 SDAR 框架,通过自蒸馏与强化学习结合实现 Agent 自我改进,核心聚焦自我进化机制。
研究机构
浙江大学
梅尔顿
论文信息