World Model Embodied AI Temporal Reasoning Latent Motion
摘要

针对现有视觉 - 语言 - 动作模型忽视视觉动态下预测性与时空因果结构的问题,本文提出 CoWVLA 新范式。该方法统一了世界模型的时间推理与解耦的潜在运动表示:首先利用预训练视频 VAE 提取潜在运动,将视频分解为结构与运动潜变量;随后在预训练中推断连续潜在运动链以预测终端帧;最后通过联合建模稀疏关键帧与动作序列,将潜在动态与离散动作预测对齐。实验表明,该方法在保留世界知识推理优势的同时,实现了高效的视觉运动学习,性能优于现有方案。

AI 推荐理由

提出世界模型思维范式,核心在于增强 Agent 对时空因果结构的预测与推理能力。

研究机构
哈尔滨工业大学 Li Auto 北京 Academy of Artificial Intelligence (BAAI) 清华大学 New South Wales大学 Chongqing Research Institute of HIT 北京大学
论文信息
作者 Fuxiang Yang, Donglin Di, Lulu Tang, Xuancheng Zhang, Lei Fan et al.
发布日期 2026-03-03
arXiv ID 2603.03195
相关性评分 9/10 (高度相关)