摘要
多模态大语言模型在视觉语言基准上进展显著,但其视觉认知与空间推理能力尚不明确。本文提出“心灵之眼”基准,包含八项受人类智力测试启发的视觉认知任务,基于“抽象 - 关系 - 变换”分类法。该基准探测模式归纳、类比映射及心理变换等流体智能核心过程。评估显示,人类准确率达 80%,而顶尖模型不足 50%。错误分析揭示了模型在视觉注意力分配、内部感知操作及视觉概念抽象方面的缺陷,表明当前模型的空间推理能力有限。
AI 推荐理由
论文核心评估多模态大模型的视觉空间推理能力,直接对应推理主题。
研究机构
CSE Dept., IIT Hyderabad, Hyderabad, India
Microsoft Research, Bengaluru, India
论文信息