摘要
端到端自动驾驶旨在从原始传感器输入生成安全且合理的规划策略。现有驾驶世界模型多关注视觉场景表征,缺乏显式的、可共享的运动表征,导致场景生成优化与精确运动规划需求之间存在割裂。本文提出 WorldDrive 框架,通过统一视觉与运动表征耦合场景生成与实时规划。该方法引入轨迹感知的驾驶世界模型,确保视觉动态与运动意图的一致性,并将编码器迁移至多模态规划器。此外,提出未来感知奖励器,利用世界模型的前瞻能力评估并选择最优轨迹。实验表明,该方法在纯视觉方法中取得了领先的规划性能。
AI 推荐理由
论文核心提出统一视觉与运动表征的框架,旨在解决场景生成与实时规划之间的割裂,显著提升规划性能。
研究机构
SKL-IOTSC, CIS, University of Macau
Afar Intelligent Drive
论文信息