摘要
可靠的驾驶助手应基于观测信息提供一致的时序接地推理响应。本文 investigates 视觉语言模型(VLM)作为驾驶助手时,是否具备真正的时序推理能力,而非仅依赖训练记忆模式。研究揭示了两大挑战:响应不一致性及时序推理能力的缺失,指出强视觉理解并不等同于优秀的时序推理。为此,作者提出了 FutureVQA 基准数据集,并引入一种无需时序标签的自监督思维链微调方法,显著提升了模型的一致性与时序推理性能。
AI 推荐理由
论文核心聚焦于 VLM 的时序推理能力与一致性,提出基于思维链的改进方法。
研究机构
DFKI Augmented Vision
TU Delft
论文信息