Embodied AI Robotics Evaluation Spatial Reasoning Real-world Benchmark
摘要

视觉 - 语言 - 动作(VLA)模型与世界模型虽前景广阔,但缺乏反映真实部署的可靠评估协议。现有基准多依赖模拟器,无法捕捉感知噪声、接触动力学等现实差距。为此,本文提出 ManipArena,一个标准化的评估框架,旨在弥合仿真与真实执行的鸿沟。该框架包含 20 项多样化任务及万余条专家轨迹,重点强调需要语义和空间推理的操作任务,支持多层级泛化测试,并涵盖长程移动操作。通过提供丰富的感官诊断信息及高保真虚实同步环境,ManipArena 为诊断和提升具身智能系统提供了公平、真实且可复现的可扩展基础。

AI 推荐理由

论文核心聚焦于评估具身智能中的语义与空间推理能力,旨在解决真实场景下的推理导向操作评估难题。

研究机构
中山大学
论文信息
作者 Yu Sun, Meng Cao, Ping Yang, Rongtao Xu, Yunxiao Yan et al.
发布日期 2026-03-30
arXiv ID 2603.28545
相关性评分 9/10 (高度相关)