摘要
大语言模型正被部署于多智能体系统以突破上下文限制,但智能体能否可靠地利用分布式信息进行计算而非仅交换信息尚不明确。本文提出 Silo-Bench,一个包含 30 个算法任务的角色无关基准,涵盖三种通信复杂度级别。实验揭示了根本性的“通信 - 推理差距”:智能体虽能自发形成协调拓扑并主动交换信息,却系统性地无法将分布式状态综合为正确答案。失败集中于推理整合阶段,且随规模扩大抵消并行化收益。
AI 推荐理由
论文核心揭示多智能体在分布式信息整合阶段的推理失败,直接针对推理能力。
研究机构
北京理工大学
ETH Zurich, Switzerland
论文信息