Multimodal LLM Visual Reasoning Benchmark Spatial Intelligence
摘要

多模态大语言模型在视觉语言基准上进展显著,但其视觉认知与空间推理能力尚不明确。本文提出“心灵之眼”基准,包含八项受人类智力测试启发的视觉认知任务,基于“抽象 - 关系 - 变换”分类法。该基准探测模式归纳、类比映射及心理变换等流体智能核心过程。评估显示,人类准确率达 80%,而顶尖模型不足 50%。错误分析揭示了模型在视觉注意力分配、内部感知操作及视觉概念抽象方面的缺陷,表明当前模型的空间推理能力有限。

AI 推荐理由

论文核心评估多模态大模型的视觉空间推理能力,直接对应推理主题。

研究机构
CSE Dept., IIT Hyderabad, Hyderabad, India Microsoft Research, Bengaluru, India
论文信息
作者 Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu
发布日期 2026-04-17
arXiv ID 2604.16054
相关性评分 9/10 (高度相关)