摘要
人类视觉推理由主动视觉主导,即元认知控制驱动自上而下的目标导向注意力。相比之下,现代视觉语言模型(VLM)被动处理信息,导致空间推理能力稀释及语言幻觉。本文提出 GazeVLM,将这种元认知监督内化至推理循环中。该模型能自主生成注视令牌,动态控制因果注意力掩码,实现对无关视觉特征的抑制和局部聚焦推理,无需依赖外部裁剪工具或扩大上下文窗口。经定制的策略优化训练,GazeVLM 在高分辨率多模态推理任务上显著超越同类最先进模型及基于智能体的多模态流程。
AI 推荐理由
论文提出通过内部注意力控制模拟主动视觉,核心旨在解决多模态推理中的空间推理与幻觉问题。
研究机构
IBM Research
ETH Zurich
TU Wien
论文信息