Autonomous Driving Vision-Language-Action Trajectory Planning Streaming Architecture
摘要

针对现有视觉 - 语言 - 动作(VLA)模型在自动驾驶规划质量上不及视觉 - 动作(VA)模型的问题,本文提出 MindVLA-U1,首个用于自动驾驶的统一流式 VLA 架构。该架构在单一前向传播中同时生成自回归语言令牌和连续动作轨迹,利用学习到的记忆通道跨帧传递时序上下文,确保规划轨迹平滑演进。通过语言预测的驾驶意图引导动作扩散,实现了从语义推理到连续控制的无缝衔接。实验表明,该方法在长尾基准上首次超越人类驾驶员,并在规划精度上大幅领先现有方法。

AI 推荐理由

论文核心解决自动驾驶规划质量问题,提出统一架构以优化轨迹生成与任务规划。

研究机构
CUHK MMLab Tsinghua University
论文信息
作者 Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang et al.
发布日期 2026-05-12
arXiv ID 2605.12624
相关性评分 9/10 (高度相关)