Multi-Agent Systems Sequential Decision Making Controller Optimization Heterogeneous LLMs
摘要

针对现有大语言模型多智能体系统控制器仅支持单次路由、缺乏中间草稿批判与迭代优化机制的局限,本文提出一种迭代批判与路由控制器。该方法将多智能体协调建模为序列决策问题,在每一步评估当前草案并决定停止或选择下一智能体进行 refinement。通过构建有限视界马尔可夫决策过程及复合奖励函数,利用策略梯度优化控制器。实验表明,该方法在多个基准测试中显著优于现有基线,大幅缩小与最强智能体的差距,且调用次数更少。

AI 推荐理由

提出基于 MDP 的迭代批判与路由控制器,核心解决多智能体任务规划与序列决策问题。

研究机构
中国
论文信息
作者 Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton
发布日期 2026-05-09
arXiv ID 2605.08686
相关性评分 9/10 (高度相关)