spatial reasoning multimodal agents benchmark interactive evaluation embodied AI
摘要

空间推理是多模态大语言模型感知与操作物理世界的基础能力。现有基准多依赖被动评估或特定模拟器,无法有效衡量通用交互式空间理解。本文提出 SpatialWorld,一个统一基准,旨在评估多模态 Agent 在复杂真实任务中的交互式空间理解能力。该基准整合八个异构模拟后端,包含 760 个人工标注任务,要求 Agent 在仅视觉部分可观测条件下主动收集证据并做出决策。评估显示,即使最强模型任务成功率也仅为 17.4%,表明主动探索与长程规划仍是主要瓶颈。

AI 推荐理由

论文核心评估多模态 Agent 的交互式空间推理能力,属推理领域关键研究。

研究机构
清华大学 重庆大学 北京大学 浙江大学 西安交通大学 北京邮电大学 东南大学
论文信息
作者 Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang et al.
发布日期 2026-06-08
arXiv ID 2606.09669
相关性评分 9/10 (高度相关)