摘要
针对现有自动驾驶基准局限于自车视角的问题,本文提出 V2X-QA,一个涵盖自车、基础设施及协同视角的真实世界多模态推理数据集与基准。该基准采用视图解耦评估协议,包含感知、预测及推理规划等十二类任务。实验表明,视图可访问性显著影响模型性能,且协同推理因需跨视图对齐而极具挑战。为此,作者提出 V2X-MoE 基线模型,通过显式视图路由和特定视图 LoRA 专家提升多视角推理能力,为网联自动驾驶中的多视角物理智能研究奠定基础。
AI 推荐理由
论文核心构建多视角推理数据集与基准,并提出显式视图路由机制解决跨视角对齐与证据整合的推理难题。
研究机构
威斯康星大学麦迪逊分校土木与环境工程学院,美国威斯康星州麦迪逊市,53706
兰卡斯特大学交通学院,英国兰卡斯特,LA1 4YW
北京交通大学交通运输学院,中国北京市,100044
南京东南大学交通学院,中国江苏省南京市,211199
论文信息