摘要
本文提出 M$^3$-VQA,一种新型基于知识的视觉问答基准,旨在提升多模态大语言模型在细粒度多模态实体理解与复杂多跳推理方面的评估能力。不同于现有数据集关注粗粒度类别及单实体简单推理,该基准引入涉及视觉与文本来源中多个不同实体的多样化问题,要求模型在多文档间执行顺序与并行多跳推理,并提供可追溯的详细证据及精心构建的多模态知识库。实验评估了 16 个主流模型,结果显示缺乏外部知识时表现不佳,而提供精确证据后显著提升,且具备推理意识的智能检索优于启发式方法,突显了结构化推理的重要性。
AI 推荐理由
论文核心聚焦多实体、多跳视觉推理,构建基准评估并验证结构化推理对复杂理解的关键作用。
研究机构
中国科学院自动化研究所
中国科学院人工智能研究院
论文信息