摘要
多模态思维链(MCoT)模型在复杂视觉推理任务中表现优异,但因生成过程中视觉注意力衰减而面临严重幻觉问题。鉴于 MCoT 与传统大视觉语言模型推理过程的本质差异,本文系统探究了 MCoT 的幻觉模式,发现伪造文本主要产生于被称为“发散思维”的联想推理步骤。基于此洞察,作者提出一种简单有效的策略,能够定位发散思维步骤并在解码过程中进行干预以缓解幻觉。实验表明,该方法显著优于现有方案,且易于与其他缓解方法集成以进一步提升性能。
AI 推荐理由
论文聚焦多模态思维链中的幻觉问题,深入分析联想推理步骤,属于推理能力核心研究。
研究机构
School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China
National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China
论文信息