摘要
多模态大语言模型(MLLMs)已成为视觉推理和基于图像问答的关键接口,但仍易受视觉幻觉影响,即生成内容与图像矛盾或提及不存在对象。本文指出,幻觉并非仅因缺乏视觉关注,模型可能在分配大量注意力仍得出错误结论。研究发现,通过层间拉普拉斯能量衡量的视觉注意力高频结构,能揭示幻觉偏好出现及真实答案短暂恢复的层级。据此提出 LaSCD,一种无需训练的解码策略,利用拉普拉斯能量选择信息层并重构下一 token 概率。实验表明该方法显著减少幻觉且保持通用能力。
AI 推荐理由
论文聚焦多模态推理中的幻觉问题,通过分析注意力结构提升推理准确性,属推理能力关键研究。
研究机构
Thrust of Artificial Intelligence, HKUST (Guangzhou), China
Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China
论文信息