摘要
遥感视觉 - 语言模型通常依赖预训练视觉编码器将图像转化为语义特征,但这可能过早压缩局部视觉证据,导致细粒度空间推理易受语言先验影响。本文提出 SkyNative,一种采用无编码器架构的原生多模态框架,直接将图像表示为原始 patch 令牌。通过引入模态感知解耦机制,该框架在统一自回归主干中协调低层视觉补丁与文本令牌。实验表明,SkyNative 在标准理解任务及大格式空间推理评估中,展现出更强的图像 grounding 感知能力及对提示诱导语言先验的鲁棒性。
AI 推荐理由
论文核心解决遥感图像中的细粒度空间推理问题,提出无编码器架构以增强视觉证据推理。
研究机构
1
2
论文信息