Remote Sensing Multimodal Learning Visual Reasoning Encoder-free
摘要

遥感视觉 - 语言模型通常依赖预训练视觉编码器将图像转化为语义特征,但这可能过早压缩局部视觉证据,导致细粒度空间推理易受语言先验影响。本文提出 SkyNative,一种采用无编码器架构的原生多模态框架,直接将图像表示为原始 patch 令牌。通过引入模态感知解耦机制,该框架在统一自回归主干中协调低层视觉补丁与文本令牌。实验表明,SkyNative 在标准理解任务及大格式空间推理评估中,展现出更强的图像 grounding 感知能力及对提示诱导语言先验的鲁棒性。

AI 推荐理由

论文核心解决遥感图像中的细粒度空间推理问题,提出无编码器架构以增强视觉证据推理。

研究机构
1 2
论文信息
作者 Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Jiashun Zhu et al.
发布日期 2026-05-18
arXiv ID 2605.17949
相关性评分 9/10 (高度相关)