VLM Embodied AI Benchmark Skill Evaluation
摘要

针对现有视觉语言模型(VLM)具身智能体基准依赖非原生高层指令且缺乏细粒度评估的问题,本文提出 NativeEmbodied 基准。该基准采用统一的低层原生动作空间,包含复杂场景下的高层任务及四种针对基础具身技能的底层任务。实验表明,当前最先进 VLM 在基础技能上存在明显缺陷,严重制约了高层任务表现。本研究为未来具身智能体研究提供了关键挑战分析与指导。

AI 推荐理由

论文核心在于解耦并评估具身智能体的基础技能,直接针对技能学习与评估机制。

研究机构
中国科学院大学 阿里巴巴集团 独立研究员
论文信息
作者 Bo Peng, Pi Bu, Keyu Pan, Xinrun Xu, Yinxiu Zhao et al.
发布日期 2026-02-24
arXiv ID 2602.20687
相关性评分 9/10 (高度相关)