摘要
视觉语言模型在地面视角表现优异,但在高空无人机场景中因域偏移而失效。为此,本文提出 UAVReason,首个专注于俯视无人机场景的统一多模态大规模基准。该基准包含超 27.3 万组视觉问答对及多模态生成样本,涵盖 22 种时空推理类型,并评估 RGB、深度及分割模态的高保真生成能力。实验表明,通用模型在此领域存在局限,而统一多任务学习能显著提升无人机原生性能。
AI 推荐理由
论文核心构建无人机场景推理基准,评估多模态时空推理能力,直接针对推理主题。
研究机构
北京工业大学
CSIRO DATA61
哈尔滨工业大学
澳门大学
论文信息