VideoQA Numerical Reasoning Benchmark VLM
摘要

本文提出 VidNum-1.4K,一个包含 1379 个人工标注样本的视频问答基准,旨在评估视觉语言模型在复杂动态场景中的真实数值推理能力。该基准采用三级层级结构,从直接视觉感知进阶至基于视频的组合数值推理,要求模型执行算术运算、比较及基于时间证据的逻辑推导。实验显示,现有最先进模型在此任务上表现不佳,揭示了其缺乏稳定的“内部世界模型”,证明了该基准作为下一代视频智能诊断测试床的重要性。

AI 推荐理由

论文核心聚焦视频数值推理,构建基准评估逻辑推导与算术能力。

研究机构
北京师范大学心理学院, 北京, 中国 深圳湾实验室, 深圳, 广东, 中国
论文信息
作者 Shaoyang Cui, Lingbei Meng
发布日期 2026-04-04
arXiv ID 2604.03701
相关性评分 9/10 (高度相关)