Autonomous Driving World Models Trajectory Planning Multimodal Learning
摘要

视觉 - 语言 - 动作(VLA)模型在端到端自动驾驶中进展显著,但常缺乏对时间动态和全局一致性的显式建模,限制了其前瞻性。本文提出 VLA-World,一种统一预测性想象与反思性推理的 VLA 世界模型。该模型首先利用动作导出的可行轨迹引导下一帧图像生成,捕捉环境演化的时空线索;随后基于自生成的未来想象帧进行推理,以修正预测轨迹。实验表明,该方法在规划和未来生成基准上均优于现有最先进模型。

AI 推荐理由

论文核心在于利用世界模型进行未来场景想象以优化轨迹规划,显著提升驾驶前瞻性与安全性。

研究机构
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University Central Research Institute, Huawei
论文信息
作者 Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng et al.
发布日期 2026-04-10
arXiv ID 2604.09059
相关性评分 9/10 (高度相关)