摘要
驾驶视觉 - 语言 - 行动模型(Driving VLAs)常引入自然语言推理作为端到端规划的中间接口,但面临标注难、长链生成理解难及延迟高等瓶颈。本文提出以简洁的“一步元动作”替代冗长推理,该接口语义明确、熵值低且可自动从专家轨迹推导。基于此,作者提出 DriveMA 框架,结合以动作为中心的监督训练与回合级信用分配强化学习,联合优化元动作正确性、轨迹质量及一致性。实验表明,DriveMA 在 Waymo 挑战赛中刷新最先进成绩,并在 NAVSIM 上表现优异,证明了其在表达力、可预测性与推理效率间的优越平衡。
AI 推荐理由
论文核心提出用一步元动作替代长推理链,旨在优化端到端驾驶规划的效率与质量。
研究机构
上海齐智研究院
清华大学
同济大学
论文信息