摘要
针对现有视觉 - 语言 - 动作模型忽视视觉动态下预测性与时空因果结构的问题,本文提出 CoWVLA 新范式。该方法统一了世界模型的时间推理与解耦的潜在运动表示:首先利用预训练视频 VAE 提取潜在运动,将视频分解为结构与运动潜变量;随后在预训练中推断连续潜在运动链以预测终端帧;最后通过联合建模稀疏关键帧与动作序列,将潜在动态与离散动作预测对齐。实验表明,该方法在保留世界知识推理优势的同时,实现了高效的视觉运动学习,性能优于现有方案。
AI 推荐理由
提出世界模型思维范式,核心在于增强 Agent 对时空因果结构的预测与推理能力。
研究机构
哈尔滨工业大学
Li Auto
北京 Academy of Artificial Intelligence (BAAI)
清华大学
New South Wales大学
Chongqing Research Institute of HIT
北京大学
论文信息