autonomous driving world model motion planning vision-language model
摘要

端到端自动驾驶旨在从原始传感器输入生成安全且合理的规划策略。现有驾驶世界模型多关注视觉场景表征,缺乏显式的、可共享的运动表征,导致场景生成优化与精确运动规划需求之间存在割裂。本文提出 WorldDrive 框架,通过统一视觉与运动表征耦合场景生成与实时规划。该方法引入轨迹感知的驾驶世界模型,确保视觉动态与运动意图的一致性,并将编码器迁移至多模态规划器。此外,提出未来感知奖励器,利用世界模型的前瞻能力评估并选择最优轨迹。实验表明,该方法在纯视觉方法中取得了领先的规划性能。

AI 推荐理由

论文核心提出统一视觉与运动表征的框架,旨在解决场景生成与实时规划之间的割裂,显著提升规划性能。

研究机构
SKL-IOTSC, CIS, University of Macau Afar Intelligent Drive
论文信息
作者 Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong et al.
发布日期 2026-03-16
arXiv ID 2603.14948
相关性评分 9/10 (高度相关)