摘要
人类生活在几何结构与语义内容随时间演变的物理 4D 世界中。尽管当前多模态大语言模型(MLLM)擅长静态视觉理解,但其是否具备“动态思维”能力尚不明确。本文引入 Dyn-Bench,一个基于真实与合成视频构建的大规模基准,旨在系统评估模型的时空推理及局部动态感知能力。研究发现现有模型难以兼顾时空推理与动态对象定位,且传统提示策略改进有限。相比之下,掩码引导融合与时空文本认知地图等结构化集成方法显著提升了模型在物理 4D 世界中的动态感知与时空推理表现。
AI 推荐理由
论文核心评估并提升 MLLM 在动态物理世界中的时空推理能力,提出新基准与增强方法。
研究机构
XMU
THU
SUSTech
CUHK
SJTU
SZTU
JNU
论文信息