摘要
图表问答(DQA)要求模型解释结构化视觉表示。尽管现有视觉语言模型(VLMs)准确率较高,但往往未将推理建立在支持预测的图表区域上,而是依赖文本相关性或数据伪影。为此,本文提出 DRAGON 基准,旨在评估图表中的证据接地视觉推理。给定图表、问题和答案,模型需预测证明答案所需的视觉元素边界框。该数据集包含来自六个现有数据集的 11,664 个标注实例,并发布了一个含人工验证推理证据标注的测试集及标准化评估框架,以系统评估并推动基于视觉证据的推理研究。
AI 推荐理由
论文核心聚焦于评估模型在图表中的证据 grounding 视觉推理能力,直接针对推理机制。
研究机构
Arizona State University
University of Maryland
论文信息