Multimodal LLM Video Understanding Spatiotemporal Reasoning Benchmark
摘要

随着具身智能体的兴起,对时空视频理解的需求日益增长,但现有基准多侧重于提取式推理。本文探讨了多模态大语言模型(MLLMs)执行抽象时空推理的能力,即整合时间观测、结合分散线索并推断隐含结构。为此,我们形式化了抽象时空推理任务,构建了可控的合成第一人称视频数据集,并提出了 VAEX-BENCH 基准,包含五项抽象推理任务及其提取式对照实验。实验揭示了当前 SOTA 模型在抽象任务上的局限性与底层瓶颈。

AI 推荐理由

论文核心聚焦于评估 MLLM 在视频中的抽象时空推理能力,构建基准并分析推理瓶颈。

研究机构
韩国国立科学技术院(UNIST) 韩国先进科学技术院(KAIST)
论文信息
作者 Seunghwan Bang, Hwanjun Song
发布日期 2026-03-13
arXiv ID 2603.13091
相关性评分 9/10 (高度相关)