摘要
本文发现多模态大语言模型(MLLMs)中的视觉注意力存在显著惯性,即在解码早期固定后难以动态调整,导致无法支持所需的组合式认知推理。针对现有方法难以解决的涉及对象间关系推导的认知幻觉问题,作者提出了一种无需训练的“惯性感知视觉激发”(IVE)方法。该方法通过建模视觉注意力的动态响应来打破惯性模式,筛选出相对于历史趋势动态涌现的视觉令牌,并引入惯性感知惩罚机制,防止注意力过度集中或滞留在局部区域。实验表明,IVE 在多种基座模型和基准测试中有效缓解了认知幻觉。
AI 推荐理由
论文核心解决多模态模型因注意力惯性导致的认知推理失败及幻觉问题。
研究机构
清华大学
论文信息