Visual Reasoning Benchmark Evidence Grounding Diagram QA VLM Evaluation
摘要

图表问答(DQA)要求模型解释结构化视觉表示。尽管现有视觉语言模型(VLMs)准确率较高,但往往未将推理建立在支持预测的图表区域上,而是依赖文本相关性或数据伪影。为此,本文提出 DRAGON 基准,旨在评估图表中的证据接地视觉推理。给定图表、问题和答案,模型需预测证明答案所需的视觉元素边界框。该数据集包含来自六个现有数据集的 11,664 个标注实例,并发布了一个含人工验证推理证据标注的测试集及标准化评估框架,以系统评估并推动基于视觉证据的推理研究。

AI 推荐理由

论文核心聚焦于评估模型在图表中的证据 grounding 视觉推理能力,直接针对推理机制。

研究机构
Arizona State University University of Maryland
论文信息
作者 Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha et al.
发布日期 2026-04-28
arXiv ID 2604.25231
相关性评分 9/10 (高度相关)