Autonomous Driving Latent Reasoning Vision-Language-Action Trajectory Planning
摘要

针对现有视觉 - 语言 - 动作(VLA)模型依赖显式文本思维链导致语义与感知脱节的问题,本文提出 LaST-VLA 框架。该框架将推理范式从离散符号处理转向物理基础的潜时空思维链,通过双重特征对齐机制,将几何约束与动态前瞻直接注入潜空间。结合从特征对齐到轨迹生成的渐进式监督微调策略,并利用群组相对策略优化强化学习确保安全性与规则遵从。实验表明,该方法在 NAVSIM 基准上创下新纪录,并在时空推理任务中表现卓越。

AI 推荐理由

论文提出潜时空思维框架,核心解决自动驾驶中感知与规划的统一及轨迹生成问题。

研究机构
清华大学 北京智行未来科技有限公司
论文信息
作者 Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang et al.
发布日期 2026-03-02
arXiv ID 2603.01928
相关性评分 9/10 (高度相关)