Multimodal RAG Deep Research Visual Grounding Hallucination Reduction
摘要

针对现有深度研究系统过度依赖文本证据或多模态利用不足的问题,本文提出 ViDR 框架。该框架将源图表视为可检索、可解释及可验证的证据对象,通过构建证据索引大纲、上下文感知过滤及视觉语言模型分析,将噪声图像转化为高质量证据原子。ViDR 还能验证视觉引用以减少幻觉,并引入 MMR Bench+ 基准评估视觉证据的使用。实验表明,该方法显著提升了报告质量、证据整合度及可验证性。

AI 推荐理由

论文核心在于通过多模态证据检索与验证增强深度研究报告的推理 grounding 能力,减少幻觉。

研究机构
School of Software and Microelectronics, Peking University, Beijing 100871, China
论文信息
作者 Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie et al.
发布日期 2026-05-13
arXiv ID 2605.13034
相关性评分 8/10 (高度相关)