Hallucination Detection VLM Interpretability Internal Reasoning
摘要

视觉语言模型常产生不存在的对象幻觉。现有检测多依赖最终层信号,忽视了底层推理过程。本文发现,幻觉源于模型在解码层间反复修正假设的“过度思考”行为,一旦锁定错误假设便会在后续层传播。为此,作者提出“过度思考分数”,通过探测中间层假设的不稳定性来量化该行为。实验表明,该指标显著提升了幻觉检测性能,在 MSCOCO 和 AMBER 数据集上 F1 分数分别达到 78.9% 和 71.58%,证明关键在于监控模型的思维过程而非仅看最终输出。

AI 推荐理由

论文深入分析 VLM 内部推理过程,揭示过度思考导致幻觉的机制,属核心推理研究。

研究机构
澳大利亚机器学习研究所
论文信息
作者 Abin Shoby, Ta Duc Huy, Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen et al.
发布日期 2026-03-08
arXiv ID 2603.07619
相关性评分 9/10 (高度相关)