Video MLLM Evidence Verification Spatio-Temporal Reasoning Benchmark
摘要

近期视频多模态大模型在各类基准测试中表现优异,但现有评估存在两大局限:一是高分可能掩盖细粒度视觉理解与推理的缺陷;二是往往未验证模型是否识别出支持预测的精确时空证据。为此,本文提出 VideoZeroBench,一个针对长视频问答的分层基准,严格验证实时空证据。该基准包含 13 个领域的 500 个手动标注问题,并配有时间区间和空间边界框作为证据。实验表明,即便最强模型在需同时满足正确回答及准确时空定位时,准确率也不足 1%,暴露了基于证据的真实推理能力的显著缺失。

AI 推荐理由

论文核心评估视频多模态模型的时空证据推理能力,揭示表面正确与真实推理的差距。

研究机构
PKU CASIA BUTT CUHK
论文信息
作者 Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren et al.
发布日期 2026-04-02
arXiv ID 2604.01569
相关性评分 9/10 (高度相关)