Autonomous Driving Reinforcement Learning Intent Conditioning Mode Collapse
摘要

针对单轨迹训练导致的连续动作策略模式坍塌问题,本文提出 DIAL 框架。该框架分两阶段:首先利用分类器自由引导将离散意图标签融入流匹配动作头,扩展采样分布以覆盖多种驾驶模式;其次通过多意图 GRPO 算法在偏好强化学习中保持分布多样性,防止微调再次坍塌。实验表明,该方法在最佳 N 采样评估中超越人类演示及先前最先进方法,证明了扩展并保持采样分布是优化连续动作策略的关键瓶颈。

AI 推荐理由

论文核心提出基于驾驶意图的规划框架,解决连续动作策略的模式坍塌问题,显著提升规划多样性与性能。

研究机构
Li Auto Tsinghua University CUHK MMILab
论文信息
作者 Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai et al.
发布日期 2026-05-12
arXiv ID 2605.12625
相关性评分 9/10 (高度相关)