摘要
大型视觉语言模型(LVLMs)在视觉问答任务中表现优异,但常依赖虚假相关性而非真正的因果推理。现有评估仅关注答案正确性,难以区分是推理能力不足还是因果信息识别错误。本文提出视觉语言因果图(VLCGs),一种显式编码因果相关对象、属性及关系的结构化表示。基于此构建 ViLCaR 诊断基准,涵盖因果归因、推断及问答任务,并引入图对齐评估指标。实验表明,注入结构化相关信息显著提升了归因与推断的一致性,表明当前局限主要源于结构指导不足而非推理能力缺失。
AI 推荐理由
论文核心研究视觉语言模型的因果推理能力,提出诊断基准与结构化表示方法。
研究机构
墨尔本大学,澳大利亚
西澳大学,澳大利亚
论文信息