Spatial Reasoning Embodied AI Benchmark Vision-Language Models
摘要

针对视觉 - 语言模型在具身领域空间认知评估的局限,本文提出 ESPIRE 诊断基准。该基准通过模拟世界将模型物理落地,评估其以空间推理为核心的机器人任务能力。不同于依赖干扰项的传统判别式评估,ESPIRE 将任务分解为定位与执行两个生成性问题,实现从被动推理到“推理以行动”的细粒度分析。研究在指令与环境层面系统设计以确保场景覆盖广泛,并对前沿模型进行了深度诊断与行为分析。

AI 推荐理由

论文核心聚焦于具身空间推理,提出诊断基准并深入分析模型推理行为。

研究机构
国家新一代人工智能开放创新平台
论文信息
作者 Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng
发布日期 2026-03-13
arXiv ID 2603.13033
相关性评分 9/10 (高度相关)