摘要
视觉 - 语言 - 动作(VLA)模型与世界模型虽前景广阔,但缺乏反映真实部署的可靠评估协议。现有基准多依赖模拟器,无法捕捉感知噪声、接触动力学等现实差距。为此,本文提出 ManipArena,一个标准化的评估框架,旨在弥合仿真与真实执行的鸿沟。该框架包含 20 项多样化任务及万余条专家轨迹,重点强调需要语义和空间推理的操作任务,支持多层级泛化测试,并涵盖长程移动操作。通过提供丰富的感官诊断信息及高保真虚实同步环境,ManipArena 为诊断和提升具身智能系统提供了公平、真实且可复现的可扩展基础。
AI 推荐理由
论文核心聚焦于评估具身智能中的语义与空间推理能力,旨在解决真实场景下的推理导向操作评估难题。
研究机构
中山大学
论文信息