Latent CoT Vision-Language Model Autonomous Driving Real-time Inference
摘要

针对自动驾驶中思维链(CoT)自回归特性导致的高延迟问题,本文提出 OneVL 框架。该方法利用紧凑的潜在令牌进行推理,并通过语言和视觉世界模型双解码器监督,迫使潜在空间内化道路几何与动态因果关系。训练采用三阶段流程对齐轨迹、语言与视觉目标。推理时仅需单次并行前向传播,在保持仅答案预测速度的同时,准确率超越显式 CoT 方法,实现了高效且可泛化的潜在推理。

AI 推荐理由

论文核心提出单步潜在推理方法,通过视觉 - 语言监督压缩思维链,显著提升推理效率与性能。

研究机构
小米智能汽车有限公司
论文信息
作者 Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li et al.
发布日期 2026-04-20
arXiv ID 2604.18486
相关性评分 9/10 (高度相关)