Mechanistic Interpretability Visual Reasoning Counting LVLM
摘要

本研究探讨大型视觉 - 语言模型(LVLM)如何实现计数任务,结合合成与真实基准及机械分析。结果显示 LVLM 表现出类人计数行为。作者提出视觉激活修补和 HeadLens 两种新可解释性方法,揭示了跨多种视觉推理任务共享的结构化“计数电路”。基于此,提出一种轻量级干预策略,仅利用合成图像微调预训练模型。该策略不仅提升了分布内计数精度,还显著改善了分布外计数基准及复杂通用视觉推理任务的表现,凸显了计数在视觉推理中的核心作用。

AI 推荐理由

论文深入探究 LVLM 的计数推理机制,通过可解释性分析揭示推理电路并提升推理能力。

研究机构
罗格斯大学 华盛顿大学 艾伦人工智能研究所
论文信息
作者 Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi et al.
发布日期 2026-03-19
arXiv ID 2603.18523
相关性评分 9/10 (高度相关)