摘要
图表问答基准旨在提出需视觉推理的问题,但模型常利用捷径或背景知识作答。为严格评估视觉推理,本文提出反事实图表方法:固定任务而变更底层数据与答案。我们引入 Chartographer 框架,将图表逆向工程为可执行代码,验证重建 fidelity,生成种子控制的反事实变体,并推导新答案。实验表明,反事实图表揭示了单一图表测试掩盖的缺陷:VLM 在面对需新颖视觉推理路径的更新图表时,泛化能力显著不足。
AI 推荐理由
论文核心在于评估 VLM 的视觉推理能力,通过反事实图表揭示模型推理捷径与泛化失败。
研究机构
University of Waterloo
Vector Institute
论文信息