摘要
针对现有视觉语言模型(VLM)具身智能体基准依赖非原生高层指令且缺乏细粒度评估的问题,本文提出 NativeEmbodied 基准。该基准采用统一的低层原生动作空间,包含复杂场景下的高层任务及四种针对基础具身技能的底层任务。实验表明,当前最先进 VLM 在基础技能上存在明显缺陷,严重制约了高层任务表现。本研究为未来具身智能体研究提供了关键挑战分析与指导。
AI 推荐理由
论文核心在于解耦并评估具身智能体的基础技能,直接针对技能学习与评估机制。
研究机构
中国科学院大学
阿里巴巴集团
独立研究员
论文信息