Causal Reasoning Vision-Language Models Evaluation Benchmark
摘要

视觉语言模型(VLMs)能生成流畅的因果解释,但现有评估难以区分语言合理性与忠实因果推理。本文提出双重探测方法隔离这两项属性:文本探测衡量语言质量,链式文本探测要求生成显式因果链。提出的“抽象差距”(AG)指标量化归一化性能差异。在涵盖 Pearl 因果层级的 CAGE 基准上评估八个 VLM 发现,七个模型 AG 超过 0.50,虽文本得分高但链式得分低。微调未能缩小差距,但某模型接近零 AG,表明该能力取决于预训练与架构选择。CAGE 为评估 VLM 忠实因果推理提供了诊断工具。

AI 推荐理由

论文核心研究视觉语言模型的因果推理能力,提出评估指标揭示抽象差距。

研究机构
Department of Electrical and Computer Engineering, University of Nebraska-Lincoln, Lincoln, Nebraska, USA
论文信息
作者 Chinh Hoang, Mohammad Rashedul Hasan
发布日期 2026-05-27
arXiv ID 2605.28779
相关性评分 9/10 (高度相关)