摘要
近期视频多模态大模型在各类基准测试中表现优异,但现有评估存在两大局限:一是高分可能掩盖细粒度视觉理解与推理的缺陷;二是往往未验证模型是否识别出支持预测的精确时空证据。为此,本文提出 VideoZeroBench,一个针对长视频问答的分层基准,严格验证实时空证据。该基准包含 13 个领域的 500 个手动标注问题,并配有时间区间和空间边界框作为证据。实验表明,即便最强模型在需同时满足正确回答及准确时空定位时,准确率也不足 1%,暴露了基于证据的真实推理能力的显著缺失。
AI 推荐理由
论文核心评估视频多模态模型的时空证据推理能力,揭示表面正确与真实推理的差距。
研究机构
PKU
CASIA
BUTT
CUHK
论文信息