Visual Question Answering Chain-of-Thought RAG Multimodal LLM
摘要

针对开放域视觉问答中外部知识需求迫切的问题,本文提出一种融合思维链推理与视觉问题分解的逻辑提示策略(CoVQD),以引导检索更精准的知识。基于此,构建了 CoVQD 引导的检索增强生成框架(CgRAG),使多模态大模型能获取更全面连贯的外部知识,并结合结构化视文推理指导,显著提升复杂跨域场景下的泛化性与可靠性。在多个基准测试上的实验验证了该方法的有效性。

AI 推荐理由

论文核心提出融合思维链与问题分解的逻辑提示策略,旨在增强多模态推理能力。

研究机构
IEEE
论文信息
作者 Quanxing Xu, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang et al.
发布日期 2026-05-05
arXiv ID 2605.03790
相关性评分 9/10 (高度相关)