Vision-Language Models Chain-of-Thought Attention Mechanism Multi-image Reasoning
摘要

多图像推理仍是视觉语言模型(VLM)的重大挑战。本文发现推理型 VLM 在生成思维链时,文本到图像的注意力呈现弥散的“脉冲”现象,无法聚焦于任务相关图像,且存在系统性位置偏差。为此,作者提出 PulseFocus 方法,这是一种无需训练的推理时技术,通过将思维链结构化为交替的计划/聚焦块并引入软注意力门控,强制模型明确规划需检查的图像并限制解码时注意力。该方法在 BLINK 和 MuirBench 等多图像基准测试中取得了显著提升。

AI 推荐理由

论文核心研究多图像推理中的注意力机制问题,提出改进思维链推理的方法。

研究机构
康奈尔大学电气与计算机工程学院
论文信息
作者 Chenjun Li
发布日期 2026-03-04
arXiv ID 2603.04676
相关性评分 9/10 (高度相关)