摘要
针对自动驾驶视觉 - 语言 - 动作(VLA)模型在强化学习中因探索受限而陷入性能 plateau 的问题,本文提出 ELF-VLA 框架。该方法摒弃模糊的标量奖励,转而生成结构化诊断报告以识别具体失败模式(如规划错误)。利用此显式反馈指导策略 refinement,并将修正后的高回报样本注入训练,从而提供针对性梯度。实验表明,该方法显著提升了长尾场景下的高层规划精度及整体驾驶评分,达到了 NAVSIM 基准的最先进水平。
AI 推荐理由
论文核心解决自动驾驶中的规划失败问题,通过显式反馈优化高层规划准确性。
研究机构
清华大学
澳门大学
北京交通大学
论文信息