Autonomous Driving Multimodal Reasoning Benchmark Vision-Language Models
摘要

针对视觉语言模型(VLM)在处理地域特定交通规则方面的不足,本文提出 GeoDrive-Bench 基准,旨在系统调查 VLM 的地理文化驱动推理能力。该基准涵盖六个国家、5053 个人工验证的多选题,涉及感知、预测、规划及地域推理四项任务。此外,文章设计了一种蒸馏算法,将地域交通规则知识注入 VLM 内部表示,以增强其对本地驾驶策略的对齐。实验表明,现有模型在地域适应性上存在显著差异,而提出的基线模型有效提升了跨区域的地理文化推理能力。

AI 推荐理由

论文核心聚焦于评估和提升 VLM 在自动驾驶中的地域性多模态推理能力,属于推理机制研究。

研究机构
University of Wisconsin-Madison Johns Hopkins University
论文信息
作者 Yingzi Ma, Chaowei Xiao, Ming Jiang
发布日期 2026-06-01
arXiv ID 2606.02774
相关性评分 9/10 (高度相关)