摘要
针对现有编排方法存在的策略崩溃、信用分配不透明及技能进化缺乏引导等挑战,本文提出 SkillFlow 框架。该框架以可训练的监督者为智能体,结合动态技能库与冻结执行器,通过多轮交互自动化任务编排。引入 tempered trajectory balance 损失以保留策略多样性,并利用联合学习的反向策略实现零成本步级信用分配。基于此,构建了递归技能进化机制,自主决定技能的创建、剪枝与时机,形成从训练信号到能力增长的闭环。实验表明其在多项任务中显著优于基线。
AI 推荐理由
论文核心提出递归技能进化机制,解决无引导进化问题,实现自主能力增长。
研究机构
香港大学
新加坡国立大学
南京理工大学
浙江大学
论文信息