摘要
针对现有视觉 - 语言 - 动作(VLA)模型依赖显式文本思维链导致语义与感知脱节的问题,本文提出 LaST-VLA 框架。该框架将推理范式从离散符号处理转向物理基础的潜时空思维链,通过双重特征对齐机制,将几何约束与动态前瞻直接注入潜空间。结合从特征对齐到轨迹生成的渐进式监督微调策略,并利用群组相对策略优化强化学习确保安全性与规则遵从。实验表明,该方法在 NAVSIM 基准上创下新纪录,并在时空推理任务中表现卓越。
AI 推荐理由
论文提出潜时空思维框架,核心解决自动驾驶中感知与规划的统一及轨迹生成问题。
研究机构
清华大学
北京智行未来科技有限公司
论文信息