摘要
大型视觉语言模型(LVLMs)在多模态理解任务中表现优异,但仍受困于物体幻觉问题。为此,本文提出区域感知链式验证(R-CoV),一种无需训练的后处理验证方法。受人类关注图像特定区域的启发,该方法引导模型生成坐标并描述局部区域,通过六步链式流程自我检测并纠正幻觉。实验表明,R-CoV 能有效集成于多种 LVLMs,显著降低物体幻觉发生率,且无需依赖外部检测模型。
AI 推荐理由
提出区域感知链式验证方法,通过多步推理检测并消除幻觉,核心在于推理机制。
研究机构
Max Planck Institute for Informatics, SIC
VIA Research Center
Google
论文信息