Multi-Agent Systems Infrastructure Awareness Reinforcement Learning Task Planning Resource Scheduling
摘要

现有大模型多智能体编排方法忽视服务基础设施的运行时状态,导致共享 GPU 集群下资源利用率低下及延迟累积。本文提出 INFRAMIND 框架,使整个多智能体栈具备基础设施感知能力。该框架包含基础设施感知规划器,依据实时系统负载和剩余预算动态选择拓扑结构;执行器根据队列深度和缓存利用率决定模型调用策略;调度器则重排序请求以优先处理紧急任务。系统被建模为分层约束马尔可夫决策过程,通过强化学习端到端优化,在多个基准测试中显著提升了准确率并降低了延迟,同时在高负载下维持了极高的服务等级目标合规率。

AI 推荐理由

提出基础设施感知的规划器,根据实时负载动态调整多智能体拓扑与路由,核心解决规划问题。

研究机构
University of Central Florida
论文信息
作者 Ahasan Kabir, Jiaqi Xue, Mengxin Zheng, Qian Lou
发布日期 2026-06-09
arXiv ID 2606.11440
相关性评分 9/10 (高度相关)