Embodied AI Tool Use Benchmark MLLM
摘要

多模态大模型(MLLMs)虽擅长调用数字 API,但在具身智能中物理工具使用的能力尚不明确。本文提出 PhysTool-Bench,首个评估 MLLM 理解现实场景、识别物理工具及规划其使用的基准。该基准涵盖 2678 种真实工具及 2510 个查询。评估显示,即使最强模型仅能识别 58.7% 的工具,端到端完成率仅 21.0%。分析揭示 MLLM 存在感知缺陷及更严重的规划短板,缺乏将感知工具映射到任务语义的功能常识,指出了具身 AI 发展的关键瓶颈。

AI 推荐理由

论文核心评估 MLLM 在物理场景中的工具选择与使用序列规划能力,直接对应规划主题。

研究机构
新加坡管理大学 香港理工大学
论文信息
作者 Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li
发布日期 2026-06-09
arXiv ID 2606.10803
相关性评分 9/10 (高度相关)