摘要
搜索增强的 LLM 代理可生成深度研究报告,但验证主张级事实性极具挑战。现有事实核查器主要针对通用领域原子主张,缺乏针对深度报告的基准。本文指出静态专家标注基准在此场景下脆弱,并提出“先审计后评分”的进化基准方法。该方法允许在 verifier 提出异议时提交证据,经仲裁后更新基准标签。实验显示,经过四轮迭代,专家准确率从 60.8% 提升至 90.9%。基于此构建了 DeepFact-Bench 基准及 DeepFact-Eval 验证代理,其性能优于现有方法并具有良好迁移性。
AI 推荐理由
论文提出基准与代理协同进化机制,核心在于通过审计反馈动态迭代更新基准。
研究机构
杜克大学
亚马逊AI
波士顿大学
论文信息