Autonomous Driving Vision-Language-Action Motion Planning Mixture-of-Transformers
摘要

视觉 - 语言 - 动作(VLA)模型在自动驾驶中展现出提升认知能力的潜力,但面临空间感知与语义推理的困境。现有系统往往顾此失彼。本文提出 UniDriveVLA,一种基于混合 Transformer 架构的统一驾驶模型,通过专家解耦解决该冲突。该模型包含理解、感知和动作规划三个专家模块,通过掩码联合注意力协调,并结合稀疏感知范式与三阶段渐进训练策略。实验表明,该方法在开环和闭环评估中均达到最先进水平,兼具强大的感知、预测及理解能力。

AI 推荐理由

论文核心解决感知与推理冲突以优化动作规划,提出专用规划专家模块。

研究机构
华南理工大学 小米汽车 澳门大学
论文信息
作者 Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan et al.
发布日期 2026-04-02
arXiv ID 2604.02190
相关性评分 9/10 (高度相关)