Causal Reasoning Video Question Answering Benchmark Vision-Language Models
摘要

视频中的因果推理是视觉语言模型(VLM)面临的重大挑战,需超越表层感知深入理解因果机制。针对现有基准缺乏细粒度证据的问题,本文提出 CaST-Bench,一个用于因果链 grounding 时空视频推理的基准。该基准包含复杂因果问题,要求模型识别并定位多段时空证据。通过人机协作构建了含 2066 个问题的高质量数据集,并设计了评估答案正确性及视觉证据 grounding 推理能力的综合指标。实验表明当前 VLM 在构建精确因果链方面存在显著不足。

AI 推荐理由

论文核心聚焦于视频中的因果链推理,提出基准评估模型的时空推理能力。

研究机构
1 2
论文信息
作者 Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan et al.
发布日期 2026-05-22
arXiv ID 2605.23216
相关性评分 9/10 (高度相关)