摘要
多模态大模型(MLLMs)虽擅长调用数字 API,但在具身智能中物理工具使用的能力尚不明确。本文提出 PhysTool-Bench,首个评估 MLLM 理解现实场景、识别物理工具及规划其使用的基准。该基准涵盖 2678 种真实工具及 2510 个查询。评估显示,即使最强模型仅能识别 58.7% 的工具,端到端完成率仅 21.0%。分析揭示 MLLM 存在感知缺陷及更严重的规划短板,缺乏将感知工具映射到任务语义的功能常识,指出了具身 AI 发展的关键瓶颈。
AI 推荐理由
论文核心评估 MLLM 在物理场景中的工具选择与使用序列规划能力,直接对应规划主题。
研究机构
新加坡管理大学
香港理工大学
论文信息