摘要
空间推理是多模态大语言模型感知与操作物理世界的基础能力。现有基准多依赖被动评估或特定模拟器,无法有效衡量通用交互式空间理解。本文提出 SpatialWorld,一个统一基准,旨在评估多模态 Agent 在复杂真实任务中的交互式空间理解能力。该基准整合八个异构模拟后端,包含 760 个人工标注任务,要求 Agent 在仅视觉部分可观测条件下主动收集证据并做出决策。评估显示,即使最强模型任务成功率也仅为 17.4%,表明主动探索与长程规划仍是主要瓶颈。
AI 推荐理由
论文核心评估多模态 Agent 的交互式空间推理能力,属推理领域关键研究。
研究机构
清华大学
重庆大学
北京大学
浙江大学
西安交通大学
北京邮电大学
东南大学
论文信息