摘要
针对复杂问题需多智能体协作的挑战,本文提出 Agent Q-Mix,一种将拓扑选择重构为合作性多智能体强化学习问题的框架。该方法利用 QMIX 值分解学习去中心化通信决策,结合拓扑感知图神经网络编码器、GRU 记忆及每智能体 Q 头,在集中训练去中心化执行范式下优化任务准确率与令牌成本的平衡。实验表明,其在编码、推理及数学基准测试中均优于现有方法,显著提升了多智能体系统的推理效率与鲁棒性。
AI 推荐理由
核心研究多智能体协作中的拓扑选择与通信规划,通过 RL 优化任务执行路径。
研究机构
University of California Los Angeles
University of Washington
Northwestern University
论文信息