Causal Reasoning Vision-Language Models Diagnostic Benchmark Structured Representation
摘要

大型视觉语言模型(LVLMs)在视觉问答任务中表现优异,但常依赖虚假相关性而非真正的因果推理。现有评估仅关注答案正确性,难以区分是推理能力不足还是因果信息识别错误。本文提出视觉语言因果图(VLCGs),一种显式编码因果相关对象、属性及关系的结构化表示。基于此构建 ViLCaR 诊断基准,涵盖因果归因、推断及问答任务,并引入图对齐评估指标。实验表明,注入结构化相关信息显著提升了归因与推断的一致性,表明当前局限主要源于结构指导不足而非推理能力缺失。

AI 推荐理由

论文核心研究视觉语言模型的因果推理能力,提出诊断基准与结构化表示方法。

研究机构
墨尔本大学,澳大利亚 西澳大学,澳大利亚
论文信息
作者 Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding
发布日期 2026-02-24
arXiv ID 2602.20878
相关性评分 9/10 (高度相关)