摘要
针对单轨迹训练导致的连续动作策略模式坍塌问题,本文提出 DIAL 框架。该框架分两阶段:首先利用分类器自由引导将离散意图标签融入流匹配动作头,扩展采样分布以覆盖多种驾驶模式;其次通过多意图 GRPO 算法在偏好强化学习中保持分布多样性,防止微调再次坍塌。实验表明,该方法在最佳 N 采样评估中超越人类演示及先前最先进方法,证明了扩展并保持采样分布是优化连续动作策略的关键瓶颈。
AI 推荐理由
论文核心提出基于驾驶意图的规划框架,解决连续动作策略的模式坍塌问题,显著提升规划多样性与性能。
研究机构
Li Auto
Tsinghua University
CUHK MMILab
论文信息