Vision-Language Models Autonomous Driving Temporal Reasoning Reliability Chain-of-Thought
摘要

可靠的驾驶助手应基于观测信息提供一致的时序接地推理响应。本文 investigates 视觉语言模型(VLM)作为驾驶助手时,是否具备真正的时序推理能力,而非仅依赖训练记忆模式。研究揭示了两大挑战:响应不一致性及时序推理能力的缺失,指出强视觉理解并不等同于优秀的时序推理。为此,作者提出了 FutureVQA 基准数据集,并引入一种无需时序标签的自监督思维链微调方法,显著提升了模型的一致性与时序推理性能。

AI 推荐理由

论文核心聚焦于 VLM 的时序推理能力与一致性,提出基于思维链的改进方法。

研究机构
DFKI Augmented Vision TU Delft
论文信息
作者 Chun-Peng Chang, Chen-Yu Wang, Holger Caesar, Alain Pagani
发布日期 2026-03-10
arXiv ID 2603.09512
相关性评分 9/10 (高度相关)