VLM 计数能力 注意力机制 多模态推理 机制分析
摘要

视觉语言模型(VLM)在复杂多模态推理任务中表现优异,却在物体计数等基础接地技能上频频失效。现有评估多关注最终输出,难以揭示模型内部故障根源。本文通过行为与机制分析,提出 COUNTINGTRICKS 评估套件,暴露不同分块布局及对抗提示下的脆弱性。注意力分析表明,计数相关视觉证据在模态投影阶段最强,但在后续语言层显著退化,模型更易受文本先验影响。据此,本文评估了模态注意力共享(MAS)干预方法,鼓励生成答案时保留最低限度的视觉注意力。结果表明,VLM 计数失败不仅源于视觉感知局限,更因语言推理阶段视觉证据利用不足。

AI 推荐理由

论文深入分析 VLM 计数失败源于语言层推理中视觉证据利用不足,属核心推理研究。

研究机构
MBZUAI
论文信息
作者 Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo
发布日期 2026-04-11
arXiv ID 2604.10039
相关性评分 9/10 (高度相关)