摘要
大型语言模型是多智能体系统的基础,但其效能高度依赖编排设计。现有方法常局部优化且反馈有限。本文提出 LEMON,一种基于 LLM 的编排器,能生成整合角色、职责、能力及依赖结构的可执行规范。该方法利用局部反事实信号增强强化学习目标,仅对编辑部分进行奖励对比训练。在六个推理与编码基准测试中,LEMON 展现了最先进的多智能体编排性能。
AI 推荐理由
论文核心研究多智能体编排,涉及角色分配、依赖构建及任务执行流程规划,属规划范畴。
研究机构
Department of Computer Science and Engineering, Shanghai Jiao Tong University
论文信息