摘要
视觉 - 语言 - 动作模型作为端到端运动规划器虽有效,但在闭环评估中因传统模仿学习训练而表现脆弱。现有闭环监督方法缺乏可扩展性且无法完全建模反应式环境。本文提出 MAPLE 框架,在 VLA 模型的潜在空间中进行反应式多智能体 rollout。该框架包含两阶段训练:基于真实轨迹的监督微调,以及鼓励安全、进度和交互真实性的强化学习。MAPLE 无需外部模拟器即可实现可扩展的闭环训练,并在 Bench2Drive 上达到最先进性能。
AI 推荐理由
论文提出端到端自动驾驶规划框架,核心解决多步轨迹生成与闭环规划问题。
研究机构
Qualcomm AI Research
Qualcomm Technologies, Inc
论文信息