摘要
尽管多模态大语言模型进展显著,但航空场景下的可靠视觉问答仍具挑战。针对关键证据常由小物体、数量及关系承载,而传统密集视觉令牌难以对齐结构化语义的问题,本文提出 AeroRAG。该框架先将图像转化为包含对象类别、数量、位置及关系的结构化视觉知识,再检索相关语义块构建紧凑提示供文本大模型使用。该方法在感知与语言推理间引入显式中间接口,实验表明其在密集场景及关系敏感推理任务上显著优于现有基线。
AI 推荐理由
论文核心提出结构化检索增强框架,旨在解决细粒度航空视觉推理中的语义对齐难题。
研究机构
Research Center for Space Computing System, Zhejiang Lab, Hangzhou 311000, China
School of Cyber Science and Engineering, Zhejiang University, Zhengzhou 450000, China
论文信息