Autonomous Driving Vision-Language-Action Models End-to-End Planning Reinforcement Learning
摘要

驾驶视觉 - 语言 - 行动模型(Driving VLAs)常引入自然语言推理作为端到端规划的中间接口,但面临标注难、长链生成理解难及延迟高等瓶颈。本文提出以简洁的“一步元动作”替代冗长推理,该接口语义明确、熵值低且可自动从专家轨迹推导。基于此,作者提出 DriveMA 框架,结合以动作为中心的监督训练与回合级信用分配强化学习,联合优化元动作正确性、轨迹质量及一致性。实验表明,DriveMA 在 Waymo 挑战赛中刷新最先进成绩,并在 NAVSIM 上表现优异,证明了其在表达力、可预测性与推理效率间的优越平衡。

AI 推荐理由

论文核心提出用一步元动作替代长推理链,旨在优化端到端驾驶规划的效率与质量。

研究机构
上海齐智研究院 清华大学 同济大学
论文信息
作者 Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang zhao
发布日期 2026-05-20
arXiv ID 2605.21273
相关性评分 9/10 (高度相关)