Object Hallucination Chain-of-Verification LVLM Visual Reasoning
摘要

大型视觉语言模型(LVLMs)在多模态理解任务中表现优异,但仍受困于物体幻觉问题。为此,本文提出区域感知链式验证(R-CoV),一种无需训练的后处理验证方法。受人类关注图像特定区域的启发,该方法引导模型生成坐标并描述局部区域,通过六步链式流程自我检测并纠正幻觉。实验表明,R-CoV 能有效集成于多种 LVLMs,显著降低物体幻觉发生率,且无需依赖外部检测模型。

AI 推荐理由

提出区域感知链式验证方法,通过多步推理检测并消除幻觉,核心在于推理机制。

研究机构
Max Planck Institute for Informatics, SIC VIA Research Center Google
论文信息
作者 Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele
发布日期 2026-04-22
arXiv ID 2604.20696
相关性评分 9/10 (高度相关)