摘要
针对现有世界 - 动作模型缺乏几何基础的问题,本文提出 DriveDreamer-Policy。该模型在单一模块化架构中整合了深度生成、未来视频生成与运动规划。通过大语言模型处理多模态输入,并利用几何感知的世界表示引导未来预测与规划,实现了更连贯的想象未来与更明智的驾驶决策。实验表明,该方法在 Navsim 基准测试的闭环规划任务中表现优异,且显式深度学习增强了规划鲁棒性。
AI 推荐理由
论文核心提出统一架构,利用几何感知世界模型直接指导运动规划,显著提升闭环规划性能。
研究机构
GigaAI
University of Toronto
CUHK MMLab
论文信息