visual hallucination attention mechanism multimodal reasoning decoding strategy
摘要

多模态大语言模型(MLLMs)已成为视觉推理和基于图像问答的关键接口,但仍易受视觉幻觉影响,即生成内容与图像矛盾或提及不存在对象。本文指出,幻觉并非仅因缺乏视觉关注,模型可能在分配大量注意力仍得出错误结论。研究发现,通过层间拉普拉斯能量衡量的视觉注意力高频结构,能揭示幻觉偏好出现及真实答案短暂恢复的层级。据此提出 LaSCD,一种无需训练的解码策略,利用拉普拉斯能量选择信息层并重构下一 token 概率。实验表明该方法显著减少幻觉且保持通用能力。

AI 推荐理由

论文聚焦多模态推理中的幻觉问题,通过分析注意力结构提升推理准确性,属推理能力关键研究。

研究机构
Thrust of Artificial Intelligence, HKUST (Guangzhou), China Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China
论文信息
作者 Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong
发布日期 2026-05-12
arXiv ID 2605.11559
相关性评分 8/10 (高度相关)