Spatio-Temporal Reasoning Benchmark Video Synthesis MLLM Evaluation
摘要

时空推理是多模态大语言模型(MLLM)在现实世界运行的核心能力,精确评估该能力至关重要。现有基准多依赖静态图像或被动 curated 视频数据,限制了细粒度推理能力的评估。本文提出 VGenST-Bench,利用生成模型主动合成高度可控且多样的评估场景。我们构建了包含人类质量控制的多智能体流水线,并建立了涵盖空间尺度、视角和场景动态的综合分类法。此外,设计了分层任务套件,将低层视觉感知与高层时空推理解耦,实现了对 MLLM 时空理解能力的细粒度诊断。

AI 推荐理由

论文核心聚焦于评估 MLLM 的时空推理能力,提出新基准以诊断细粒度推理缺陷。

研究机构
人工智能学院,成均馆大学
论文信息
作者 Jinho Park, Youbin Kim, Hogun Park, Eunbyung Park
发布日期 2026-05-21
arXiv ID 2605.22570
相关性评分 9/10 (高度相关)