摘要
针对视觉语言模型(VLM)在处理地域特定交通规则方面的不足,本文提出 GeoDrive-Bench 基准,旨在系统调查 VLM 的地理文化驱动推理能力。该基准涵盖六个国家、5053 个人工验证的多选题,涉及感知、预测、规划及地域推理四项任务。此外,文章设计了一种蒸馏算法,将地域交通规则知识注入 VLM 内部表示,以增强其对本地驾驶策略的对齐。实验表明,现有模型在地域适应性上存在显著差异,而提出的基线模型有效提升了跨区域的地理文化推理能力。
AI 推荐理由
论文核心聚焦于评估和提升 VLM 在自动驾驶中的地域性多模态推理能力,属于推理机制研究。
研究机构
University of Wisconsin-Madison
Johns Hopkins University
论文信息