Multi-Agent Systems Benchmark Embodied AI Social Reasoning Planning
摘要

随着大语言模型向自主智能体转型,评估其在具身多智能体环境中的社会推理能力至关重要。本文提出 SocialGrid,一个受《Among Us》启发的具身多智能体环境,用于评估智能体的规划、任务执行及社会推理能力。评估显示,即便最强开源模型在任务完成与规划上的准确率也不足 60%,常陷入重复行为或导航失败。为排除导航缺陷对社会智力评估的干扰,SocialGrid 提供可选的“规划预言机”以隔离社会推理能力。研究发现,即便有规划辅助,社会推理仍是瓶颈,智能体难以识别欺骗。该基准提供自动故障分析与细粒度指标,并建立了基于对抗赛制的排行榜。

AI 推荐理由

论文核心是评估具身多智能体在复杂环境中的任务规划与执行能力,并专门设计了隔离规划缺陷的机制。

研究机构
Technical University of Darmstadt German Research Center for Artificial Intelligence Lab141
论文信息
作者 Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting
发布日期 2026-04-17
arXiv ID 2604.16022
相关性评分 9/10 (高度相关)