摘要
视频中的因果推理是视觉语言模型(VLM)面临的重大挑战,需超越表层感知深入理解因果机制。针对现有基准缺乏细粒度证据的问题,本文提出 CaST-Bench,一个用于因果链 grounding 时空视频推理的基准。该基准包含复杂因果问题,要求模型识别并定位多段时空证据。通过人机协作构建了含 2066 个问题的高质量数据集,并设计了评估答案正确性及视觉证据 grounding 推理能力的综合指标。实验表明当前 VLM 在构建精确因果链方面存在显著不足。
AI 推荐理由
论文核心聚焦于视频中的因果链推理,提出基准评估模型的时空推理能力。
研究机构
1
2
论文信息