Skill Evolution Flow Matching Agent Orchestration Credit Assignment
摘要

针对现有编排方法存在的策略崩溃、信用分配不透明及技能进化缺乏引导等挑战,本文提出 SkillFlow 框架。该框架以可训练的监督者为智能体,结合动态技能库与冻结执行器,通过多轮交互自动化任务编排。引入 tempered trajectory balance 损失以保留策略多样性,并利用联合学习的反向策略实现零成本步级信用分配。基于此,构建了递归技能进化机制,自主决定技能的创建、剪枝与时机,形成从训练信号到能力增长的闭环。实验表明其在多项任务中显著优于基线。

AI 推荐理由

论文核心提出递归技能进化机制,解决无引导进化问题,实现自主能力增长。

研究机构
香港大学 新加坡国立大学 南京理工大学 浙江大学
论文信息
作者 Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao et al.
发布日期 2026-05-13
arXiv ID 2605.14089
相关性评分 9/10 (高度相关)