摘要
尽管大型视觉语言模型(VLM)进展显著,空间推理仍是挑战。本文通过机械可解释性视角,探究 VLM 内部注意力头对空间推理的贡献。我们构建了 CogVSR 数据集,将复杂空间问题分解为模拟人类思维链的子问题,并开发探测框架识别专用功能头。研究发现此类功能头普遍稀疏且空间专用头尤为稀缺。通过激活潜在空间头及干预实验,证实了其对提升空间理解与推理准确性的关键作用,为增强多模态模型的复杂推理提供了新见解。
AI 推荐理由
论文核心研究 VLM 的空间推理机制,通过可解释性分析注意力头功能,直接提升推理能力。
研究机构
墨尔本大学
莫纳什大学
论文信息