Autonomous Driving Closed-loop Training Multi-Agent Reinforcement Learning
摘要

视觉 - 语言 - 动作模型作为端到端运动规划器虽有效,但在闭环评估中因传统模仿学习训练而表现脆弱。现有闭环监督方法缺乏可扩展性且无法完全建模反应式环境。本文提出 MAPLE 框架,在 VLA 模型的潜在空间中进行反应式多智能体 rollout。该框架包含两阶段训练:基于真实轨迹的监督微调,以及鼓励安全、进度和交互真实性的强化学习。MAPLE 无需外部模拟器即可实现可扩展的闭环训练,并在 Bench2Drive 上达到最先进性能。

AI 推荐理由

论文提出端到端自动驾驶规划框架,核心解决多步轨迹生成与闭环规划问题。

研究机构
Qualcomm AI Research Qualcomm Technologies, Inc
论文信息
作者 Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi et al.
发布日期 2026-05-13
arXiv ID 2605.14201
相关性评分 9/10 (高度相关)