4D 推理 多模态大模型 时空对话 目标跟踪
摘要

近期大型多模态模型(LMM)在图像和视频理解上表现优异,但在维持 4D 连续时空动态推理方面仍存在不足。为研究这一差距,本文提出了“轨迹引导的多轮时空对话”新任务,要求模型在回答时空查询的同时返回结构化的 3D 目标轨迹,并引入了包含 526 个片段级对话样本的 Track4D-Bench 基准。基于此,作者提出 LMM-Track4D 方法,结合射线 - 时间几何编码、专用流式状态令牌及对象槽运动学解码器,实现了稳定的 4 步 3D 状态估计。实验表明,显式的动态状态建模是激发 4D 动态推理的有效设计原则。

AI 推荐理由

论文核心在于通过轨迹引导对话激发 LMM 的 4D 时空动态推理能力,属于推理机制研究。

研究机构
华中科技大学 北京大学 山东大学
论文信息
作者 Chaoyue Li, Yongxue Xu, Jie Feng, Jiayu Ding
发布日期 2026-05-19
arXiv ID 2605.19390
相关性评分 9/10 (高度相关)