摘要
视觉 - 语言 - 动作(VLA)模型在自动驾驶中展现出提升认知能力的潜力,但面临空间感知与语义推理的困境。现有系统往往顾此失彼。本文提出 UniDriveVLA,一种基于混合 Transformer 架构的统一驾驶模型,通过专家解耦解决该冲突。该模型包含理解、感知和动作规划三个专家模块,通过掩码联合注意力协调,并结合稀疏感知范式与三阶段渐进训练策略。实验表明,该方法在开环和闭环评估中均达到最先进水平,兼具强大的感知、预测及理解能力。
AI 推荐理由
论文核心解决感知与推理冲突以优化动作规划,提出专用规划专家模块。
研究机构
华南理工大学
小米汽车
澳门大学
论文信息