摘要
针对自动驾驶在未见场景下的泛化挑战及现有世界模型规划中视频 - 轨迹不一致的问题,本文提出 DriveVA。该模型通过在共享潜在生成过程中联合解码未来视觉预测与动作序列,利用预训练视频生成模型的先验知识捕捉时空演化规律。采用基于 DiT 的解码器紧密对齐规划与场景演化,并引入视频延续策略增强长时一致性。实验表明,DriveVA 在 NAVSIM 基准上取得优异闭环性能,并在跨域零样本设置下显著降低误差与碰撞率。
AI 推荐理由
论文提出基于世界模型的自动驾驶规划方法,核心解决任务规划与场景演化的一致性问题。
研究机构
University of Twente
Xiaomi EV
University of Cambridge
University of Bath
论文信息