摘要
迭代检索增强生成(iRAG)是回答复杂多跳问题的有力范式,但现有系统主要基于解析文本,存在归因粒度粗糙和视觉语义丢失两大瓶颈。为此,本文提出“证据链”(CoE),这是一种与检索器无关的视觉归因框架,利用视觉语言模型直接对检索到的文档截图进行推理。CoE 消除了特定格式的解析需求,输出精确的边界框,在候选集中可视化完整的推理链。在 Wiki-CoE 和 SlideVQA 基准上的实验表明,微调后的 Qwen3-VL-8B-Instruct 在需要视觉布局理解的场景中显著优于文本基线,确立了像素级可解释 iRAG 的新方案。
AI 推荐理由
论文核心在于利用视觉语言模型进行多跳推理,通过像素级证据链解决复杂问答中的推理瓶颈。
研究机构
National Engineering Research Center for Software Engineering, Peking University, Beijing, China
City University of Hong Kong, Hong Kong SAR, China
Peking University, Beijing, China
Tencent Technology, Beijing, China
National Engineering Research Center for Software Engineering, Peking University
论文信息