Visual Reasoning Retrieval-Augmented Generation Scene Graph Aerial Imagery Multimodal LLM
摘要

尽管多模态大语言模型进展显著,但航空场景下的可靠视觉问答仍具挑战。针对关键证据常由小物体、数量及关系承载,而传统密集视觉令牌难以对齐结构化语义的问题,本文提出 AeroRAG。该框架先将图像转化为包含对象类别、数量、位置及关系的结构化视觉知识,再检索相关语义块构建紧凑提示供文本大模型使用。该方法在感知与语言推理间引入显式中间接口,实验表明其在密集场景及关系敏感推理任务上显著优于现有基线。

AI 推荐理由

论文核心提出结构化检索增强框架,旨在解决细粒度航空视觉推理中的语义对齐难题。

研究机构
Research Center for Space Computing System, Zhejiang Lab, Hangzhou 311000, China School of Cyber Science and Engineering, Zhejiang University, Zhengzhou 450000, China
论文信息
作者 Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin et al.
发布日期 2026-04-20
arXiv ID 2604.17889
相关性评分 9/10 (高度相关)