摘要
视觉语言模型在地球观测中表现良好,但在将复杂空间推理锚定于精确像素级视觉表征方面存在困难。为此,本文提出 TerraScope,一种统一的视觉语言模型,具备两大关键能力:一是模态灵活推理,能处理单模态输入并自适应融合多模态数据;二是多时相推理,整合时间序列以分析变化。此外,构建了包含百万样本的大规模数据集 Terra-CoT,并在推理链中嵌入像素级掩码。同时提出首个像素级地理空间推理基准 TerraScope-Bench,评估答案准确性与掩码质量。实验表明,该模型显著优于现有方法并提供可解释的视觉证据。
AI 推荐理由
论文核心解决复杂空间推理与像素级视觉表征的结合问题,提出多模态与时序推理机制。
研究机构
特伦托大学
BIFOLD 和 TU 柏林
慕尼黑工业大学
论文信息