摘要
本文提出 VidNum-1.4K,一个包含 1379 个人工标注样本的视频问答基准,旨在评估视觉语言模型在复杂动态场景中的真实数值推理能力。该基准采用三级层级结构,从直接视觉感知进阶至基于视频的组合数值推理,要求模型执行算术运算、比较及基于时间证据的逻辑推导。实验显示,现有最先进模型在此任务上表现不佳,揭示了其缺乏稳定的“内部世界模型”,证明了该基准作为下一代视频智能诊断测试床的重要性。
AI 推荐理由
论文核心聚焦视频数值推理,构建基准评估逻辑推导与算术能力。
研究机构
北京师范大学心理学院, 北京, 中国
深圳湾实验室, 深圳, 广东, 中国
论文信息