摘要
人类级别的代理智能超越了低级几何感知,进化为理解物体的用途。现有基准虽能评估多模态大语言模型(MLLMs)的几何感知,却难以探测具身智能所需的高阶认知能力。为此,本文提出空间 - 功能智能基准(SFI-Bench),这是一个基于视频的基准,包含源自多样化第一人称室内视频扫描的 1500 多个专家标注问题。该基准系统评估两种互补的高级推理维度:结构化空间推理与功能推理。实验表明,当前 MLLMs 在结合空间记忆、功能推理与外部知识方面存在显著困难,突显了实现具身智能的关键瓶颈。
AI 推荐理由
论文核心评估多模态模型的空间与功能推理能力,属于推理研究。
研究机构
Mila - Quebec AI Institute, UdeM
NYU
Apple
Canada CIFAR AI Chair
SFI-Bench
论文信息