Multi-Agent Systems Reinforcement Learning Orchestration Counterfactual Reasoning
摘要

大型语言模型是多智能体系统的基础,但其效能高度依赖编排设计。现有方法常局部优化且反馈有限。本文提出 LEMON,一种基于 LLM 的编排器,能生成整合角色、职责、能力及依赖结构的可执行规范。该方法利用局部反事实信号增强强化学习目标,仅对编辑部分进行奖励对比训练。在六个推理与编码基准测试中,LEMON 展现了最先进的多智能体编排性能。

AI 推荐理由

论文核心研究多智能体编排,涉及角色分配、依赖构建及任务执行流程规划,属规划范畴。

研究机构
Department of Computer Science and Engineering, Shanghai Jiao Tong University
论文信息
作者 Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding
发布日期 2026-05-14
arXiv ID 2605.14483
相关性评分 9/10 (高度相关)