Spatial Reasoning Mechanistic Interpretability Vision-Language Models Attention Heads
摘要

尽管大型视觉语言模型(VLM)进展显著,空间推理仍是挑战。本文通过机械可解释性视角,探究 VLM 内部注意力头对空间推理的贡献。我们构建了 CogVSR 数据集,将复杂空间问题分解为模拟人类思维链的子问题,并开发探测框架识别专用功能头。研究发现此类功能头普遍稀疏且空间专用头尤为稀缺。通过激活潜在空间头及干预实验,证实了其对提升空间理解与推理准确性的关键作用,为增强多模态模型的复杂推理提供了新见解。

AI 推荐理由

论文核心研究 VLM 的空间推理机制,通过可解释性分析注意力头功能,直接提升推理能力。

研究机构
墨尔本大学 莫纳什大学
论文信息
作者 Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu et al.
发布日期 2026-03-21
arXiv ID 2603.20662
相关性评分 9/10 (高度相关)