Multi-Agent Systems Reinforcement Learning Task Orchestration LLM Agents
摘要

随着大语言模型智能体从独立工具用户演变为协作团队,强化学习需优化工作的生成、委托、通信、聚合及停止策略。本文通过“编排轨迹”(包含子智能体生成、委托等事件的时间交互图)研究多智能体系统的强化学习。文章确立了奖励设计、信用信号分配及编排学习分解(何时生成、委托给谁、如何通信/聚合/停止)三大技术轴。研究指出当前缺乏针对“停止决策”的显式训练方法,并揭示了学术方法与工业部署间的规模差距,最终发布了包含标注论文池和可重放轨迹架构的开源资源。

AI 推荐理由

论文核心研究多智能体系统的任务生成、委托、聚合及停止决策,属于高级规划范畴。

研究机构
Independent Researcher
论文信息
作者 Chenchen Zhang
发布日期 2026-05-04
arXiv ID 2605.02801
相关性评分 9/10 (高度相关)