Self-Distillation Skill Learning Reinforcement Learning LLM Agents
摘要

强化学习训练多轮 LLM 代理常受限于稀疏奖励与长视界。现有自蒸馏方法虽提供密集监督,但固定特权信息无法涵盖多样策略,且易导致训练崩溃。本文提出 Skill-SD 框架,将代理轨迹动态总结为描述成功行为、错误及工作流的紧凑自然语言“技能”。这些技能作为仅教师模型可见的动态特权信息进行条件约束,学生模型则在普通提示下通过蒸馏内化指导。此外,引入重要性加权反向 KL 损失以稳定训练并同步师生模型。实验表明,该方法在多个基准上显著优于标准 RL 基线。

AI 推荐理由

论文核心提出技能条件自蒸馏框架,将轨迹总结为自然语言技能以指导代理学习,直接聚焦技能获取。

研究机构
中国科学院大学先进院 香港大学 清华大学
论文信息
作者 Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan et al.
发布日期 2026-04-12
arXiv ID 2604.10674
相关性评分 9/10 (高度相关)