摘要
随着大语言模型向自主智能体转型,评估其在具身多智能体环境中的社会推理能力至关重要。本文提出 SocialGrid,一个受《Among Us》启发的具身多智能体环境,用于评估智能体的规划、任务执行及社会推理能力。评估显示,即便最强开源模型在任务完成与规划上的准确率也不足 60%,常陷入重复行为或导航失败。为排除导航缺陷对社会智力评估的干扰,SocialGrid 提供可选的“规划预言机”以隔离社会推理能力。研究发现,即便有规划辅助,社会推理仍是瓶颈,智能体难以识别欺骗。该基准提供自动故障分析与细粒度指标,并建立了基于对抗赛制的排行榜。
AI 推荐理由
论文核心是评估具身多智能体在复杂环境中的任务规划与执行能力,并专门设计了隔离规划缺陷的机制。
研究机构
Technical University of Darmstadt
German Research Center for Artificial Intelligence
Lab141
论文信息