Spatial Reasoning Vision-Language Models Mechanism Analysis Visual Encoder
摘要

许多多模态任务要求视觉语言模型(VLM)将物体与其属性及空间关系相关联。本文揭示了 VLM 依赖两种并发机制来实现这种关联:语言模型骨干网的中间层在视觉令牌上表征内容无关的空间关系,但仅起次要作用;主导性的空间信息源自视觉编码器,其表征编码了物体布局并被骨干网直接利用。研究发现该空间信号全局分布于所有视觉令牌中。通过增强这些源自视觉的全局空间表征,显著提升了自然图像上的空间推理性能,阐明了 VLM 内空间关联的计算方式。

AI 推荐理由

论文核心研究视觉语言模型中空间推理的双重机制,深入剖析推理能力的内部计算过程。

研究机构
MIT CSAIL, Northeastern University
论文信息
作者 Kelly Cui, Nikhil Prakash, Ayush Raina, David Bau, Antonio Torralba et al.
发布日期 2026-03-23
arXiv ID 2603.22278
相关性评分 9/10 (高度相关)