Multimodal LLM Spatio-temporal Reasoning Dynamic Perception Benchmark 4D World
摘要

人类生活在几何结构与语义内容随时间演变的物理 4D 世界中。尽管当前多模态大语言模型(MLLM)擅长静态视觉理解,但其是否具备“动态思维”能力尚不明确。本文引入 Dyn-Bench,一个基于真实与合成视频构建的大规模基准,旨在系统评估模型的时空推理及局部动态感知能力。研究发现现有模型难以兼顾时空推理与动态对象定位,且传统提示策略改进有限。相比之下,掩码引导融合与时空文本认知地图等结构化集成方法显著提升了模型在物理 4D 世界中的动态感知与时空推理表现。

AI 推荐理由

论文核心评估并提升 MLLM 在动态物理世界中的时空推理能力,提出新基准与增强方法。

研究机构
XMU THU SUSTech CUHK SJTU SZTU JNU
论文信息
作者 Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou et al.
发布日期 2026-03-13
arXiv ID 2603.12746
相关性评分 9/10 (高度相关)