UAV Multimodal Reasoning Benchmark Vision-Language Models
摘要

视觉语言模型在地面视角表现优异,但在高空无人机场景中因域偏移而失效。为此,本文提出 UAVReason,首个专注于俯视无人机场景的统一多模态大规模基准。该基准包含超 27.3 万组视觉问答对及多模态生成样本,涵盖 22 种时空推理类型,并评估 RGB、深度及分割模态的高保真生成能力。实验表明,通用模型在此领域存在局限,而统一多任务学习能显著提升无人机原生性能。

AI 推荐理由

论文核心构建无人机场景推理基准,评估多模态时空推理能力,直接针对推理主题。

研究机构
北京工业大学 CSIRO DATA61 哈尔滨工业大学 澳门大学
论文信息
作者 Jintao Sun, Hu Zhang, Donglin Di, Gangyi Ding, Zhedong Zheng
发布日期 2026-04-07
arXiv ID 2604.05377
相关性评分 9/10 (高度相关)