摘要
针对现有深度研究系统过度依赖文本证据或多模态利用不足的问题,本文提出 ViDR 框架。该框架将源图表视为可检索、可解释及可验证的证据对象,通过构建证据索引大纲、上下文感知过滤及视觉语言模型分析,将噪声图像转化为高质量证据原子。ViDR 还能验证视觉引用以减少幻觉,并引入 MMR Bench+ 基准评估视觉证据的使用。实验表明,该方法显著提升了报告质量、证据整合度及可验证性。
AI 推荐理由
论文核心在于通过多模态证据检索与验证增强深度研究报告的推理 grounding 能力,减少幻觉。
研究机构
School of Software and Microelectronics, Peking University, Beijing 100871, China
论文信息