Multimodal LLM Spatial Reasoning Functional Reasoning Benchmark
摘要

人类级别的代理智能超越了低级几何感知,进化为理解物体的用途。现有基准虽能评估多模态大语言模型(MLLMs)的几何感知,却难以探测具身智能所需的高阶认知能力。为此,本文提出空间 - 功能智能基准(SFI-Bench),这是一个基于视频的基准,包含源自多样化第一人称室内视频扫描的 1500 多个专家标注问题。该基准系统评估两种互补的高级推理维度:结构化空间推理与功能推理。实验表明,当前 MLLMs 在结合空间记忆、功能推理与外部知识方面存在显著困难,突显了实现具身智能的关键瓶颈。

AI 推荐理由

论文核心评估多模态模型的空间与功能推理能力,属于推理研究。

研究机构
Mila - Quebec AI Institute, UdeM NYU Apple Canada CIFAR AI Chair SFI-Bench
论文信息
作者 Le Zhang, Jihan Yang, Soundarya Krishnan, Jimit Majmudar, Xiou Ge et al.
发布日期 2026-05-04
arXiv ID 2605.02130
相关性评分 9/10 (高度相关)