摘要
文档视觉问答(DocVQA)要求模型不仅推理出与问题相关的信息,还需定位答案在页面上的具体位置。现有模型往往将证据提取与答案定位纠缠在一起,缺乏透明度。本文提出 CoExVQA,一种具备自解释能力的 DocVQA 框架,通过“解释链”设计实现接地推理:首先识别相关证据,接着明确定位答案区域,最后仅从该区域解码答案。该方法允许直接检查和验证跨模态推理过程。实验表明,限制在接地证据上解码显著提升了可解释 DocVQA 的性能,在 PFL-DocVQA 数据集上将 ANLS 指标提高了 12%,同时提供了透明且可验证的预测结果。
AI 推荐理由
论文提出基于解释链的推理框架,核心在于增强多模态推理的可解释性与验证性。
研究机构
Department of Informatics, University of Oslo
Integreat – Norwegian Centre for Knowledge-driven Machine Learning
TRUST – The Norwegian Centre for Trustworthy AI
论文信息