Visual Reasoning Earth Observation Vision-Language Models Pixel-Grounded
摘要

视觉语言模型在地球观测中表现良好,但在将复杂空间推理锚定于精确像素级视觉表征方面存在困难。为此,本文提出 TerraScope,一种统一的视觉语言模型,具备两大关键能力:一是模态灵活推理,能处理单模态输入并自适应融合多模态数据;二是多时相推理,整合时间序列以分析变化。此外,构建了包含百万样本的大规模数据集 Terra-CoT,并在推理链中嵌入像素级掩码。同时提出首个像素级地理空间推理基准 TerraScope-Bench,评估答案准确性与掩码质量。实验表明,该模型显著优于现有方法并提供可解释的视觉证据。

AI 推荐理由

论文核心解决复杂空间推理与像素级视觉表征的结合问题,提出多模态与时序推理机制。

研究机构
特伦托大学 BIFOLD 和 TU 柏林 慕尼黑工业大学
论文信息
作者 Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir et al.
发布日期 2026-03-19
arXiv ID 2603.19039
相关性评分 9/10 (高度相关)