Multimodal LLM Autonomous Driving Cooperative Reasoning Benchmark Mixture of Experts
摘要

针对现有自动驾驶基准局限于自车视角的问题,本文提出 V2X-QA,一个涵盖自车、基础设施及协同视角的真实世界多模态推理数据集与基准。该基准采用视图解耦评估协议,包含感知、预测及推理规划等十二类任务。实验表明,视图可访问性显著影响模型性能,且协同推理因需跨视图对齐而极具挑战。为此,作者提出 V2X-MoE 基线模型,通过显式视图路由和特定视图 LoRA 专家提升多视角推理能力,为网联自动驾驶中的多视角物理智能研究奠定基础。

AI 推荐理由

论文核心构建多视角推理数据集与基准,并提出显式视图路由机制解决跨视角对齐与证据整合的推理难题。

研究机构
威斯康星大学麦迪逊分校土木与环境工程学院,美国威斯康星州麦迪逊市,53706 兰卡斯特大学交通学院,英国兰卡斯特,LA1 4YW 北京交通大学交通运输学院,中国北京市,100044 南京东南大学交通学院,中国江苏省南京市,211199
论文信息
作者 Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang et al.
发布日期 2026-04-03
arXiv ID 2604.02710
相关性评分 9/10 (高度相关)