Multi-Agent Systems Task Planning Reinforcement Learning Efficiency
摘要

大型语言模型多智能体系统通常依赖僵化的编排机制,难以在单一目标下联合优化分解深度、工作者选择及推理预算。本文提出 Uno-Orchestra,一种统一的编排策略,能够选择性地将任务分解,并将每个子任务分发至合适的(模型,原语)对。该策略的两个决策均基于真实工作者交互构建的强化学习轨迹共同习得。在涵盖数学、代码、知识等 13 个基准测试中,Uno-Orchestra 超越了 22 个基线方法,以低一个数量级的查询成本实现了 77.0% 的宏观通过率,显著推进了选择性委托的准确性与效率前沿。

AI 推荐理由

论文核心研究任务分解深度与子任务分发的联合优化,属于规划能力范畴。

研究机构
中国科学院自动化研究所
论文信息
作者 Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang et al.
发布日期 2026-05-06
arXiv ID 2605.05007
相关性评分 9/10 (高度相关)