Fine-Grained Visual Understanding Knowledge-Augmented Reasoning Multimodal Agent Open-Set Recognition
摘要

细粒度视觉理解正从静态分类转向知识增强推理,要求模型不仅能识别还需提供依据。现有方法受限于封闭集分类和单标签预测,在开放集或上下文依赖场景下表现不佳。本文提出知识增强细粒度推理智能体(KFRA),通过三阶段闭环推理模拟专家分析:首先生成类别假设,接着利用全局到局部机制对齐文本知识与视觉证据以定位判别区域,最后在多模态大模型中整合证据进行可解释推理。KFRA 建立了检索与接地的耦合机制,将检索知识转化为空间接地证据。实验表明,该方法在推理准确率上提升达 19%,实现了事实性强且可解释的开放集细粒度视觉理解。

AI 推荐理由

论文核心提出基于证据驱动的推理框架,将感知转化为推理,显著提升细粒度视觉理解中的推理能力。

研究机构
北京邮电大学人工智能学院
论文信息
作者 Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo et al.
发布日期 2026-03-04
arXiv ID 2603.03762
相关性评分 9/10 (高度相关)