Multi-Agent Systems Reinforcement Learning Workflow Learning Decentralized Planning
摘要

本文研究了在接口约束下,专用智能体通过共享工件交接控制权的分布式工作流学习问题。作者将该场景形式化为接口约束半马尔可夫决策过程(IC-SMDP),并提出了一种异步去中心化 Q 学习算法 IC-Q,其每次交接仅需标量协调。理论方面,首次推导了神经 IC-Q 的有限样本误差界;实验方面,在多 LLM 数学推理等任务中验证了该算法在无全局轨迹观测下能达到集中式 oracle 的性能。

AI 推荐理由

论文核心研究多智能体工作流中的任务交接与协调机制,属于分布式规划范畴。

研究机构
斯特恩商学院, 纽约大学, 纽约, 纽约州 10012 计算机科学系, 达特茅斯学院, 汉诺威, 新罕布什尔州 03755
论文信息
作者 Jiayu Li, Enpei Zhang, Dawei Zhou, Elynn Chen, Yujun Yan
发布日期 2026-05-18
arXiv ID 2605.19140
相关性评分 9/10 (高度相关)