摘要
自动驾驶需推演环境演化并据此规划动作。现有基于世界模型的方法通常先预测未来场景再规划,导致开环想象偏离实际决策。本文提出 Uni-World VLA,一种统一视觉 - 语言 - 动作模型,紧密交错未来帧预测与轨迹规划。该模型逐步交替预测未来帧与自车动作,使规划决策持续基于想象的未来观测,形成世界建模与控制的闭环交互,提升动态交通场景下的自适应决策能力。此外,引入单目深度信息增强几何线索,改善长时程场景预测。NAVSIM 基准实验表明,该方法在实现高保真未来帧预测的同时,取得了具有竞争力的闭环规划性能。
AI 推荐理由
论文核心提出世界建模与规划交错生成的闭环机制,直接解决自动驾驶中的任务规划问题。
研究机构
复旦大学
上海人工智能实验室
李奥汽车
论文信息