摘要
视觉 - 语言 - 动作(VLA)模型在端到端自动驾驶中进展显著,但常缺乏对时间动态和全局一致性的显式建模,限制了其前瞻性。本文提出 VLA-World,一种统一预测性想象与反思性推理的 VLA 世界模型。该模型首先利用动作导出的可行轨迹引导下一帧图像生成,捕捉环境演化的时空线索;随后基于自生成的未来想象帧进行推理,以修正预测轨迹。实验表明,该方法在规划和未来生成基准上均优于现有最先进模型。
AI 推荐理由
论文核心在于利用世界模型进行未来场景想象以优化轨迹规划,显著提升驾驶前瞻性与安全性。
研究机构
MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University
Central Research Institute, Huawei
论文信息