DocVQA 可解释性 多模态推理 解释链
摘要

文档视觉问答(DocVQA)要求模型不仅推理出与问题相关的信息,还需定位答案在页面上的具体位置。现有模型往往将证据提取与答案定位纠缠在一起,缺乏透明度。本文提出 CoExVQA,一种具备自解释能力的 DocVQA 框架,通过“解释链”设计实现接地推理:首先识别相关证据,接着明确定位答案区域,最后仅从该区域解码答案。该方法允许直接检查和验证跨模态推理过程。实验表明,限制在接地证据上解码显著提升了可解释 DocVQA 的性能,在 PFL-DocVQA 数据集上将 ANLS 指标提高了 12%,同时提供了透明且可验证的预测结果。

AI 推荐理由

论文提出基于解释链的推理框架,核心在于增强多模态推理的可解释性与验证性。

研究机构
Department of Informatics, University of Oslo Integreat – Norwegian Centre for Knowledge-driven Machine Learning TRUST – The Norwegian Centre for Trustworthy AI
论文信息
作者 Kjetil Indrehus, Adrian Duric, Changkyu Choi, Ali Ramezani-Kebrya
发布日期 2026-05-07
arXiv ID 2605.06058
相关性评分 9/10 (高度相关)