Medical AI Evidence Synthesis Benchmark RAG Higher-order Reasoning
摘要

针对大语言模型在高阶推理(如多源证据综合)能力的不足,本文提出 MedMeta 基准,评估模型仅凭摘要生成医学荟萃分析结论的能力。该基准包含 81 篇荟萃分析,采用检索增强生成与纯参数两种工作流。验证显示自动评估与人类专家高度一致。研究发现信息 grounding 至关重要,RAG 显著优于内部知识;但所有模型均无法识别否定证据,且在理想 RAG 条件下表现仅略高于平均水平,表明构建稳健 RAG 系统比单纯模型微调更具前景。

AI 推荐理由

论文聚焦高阶推理(证据综合),评估模型整合多源信息能力,属推理核心任务。

论文信息
作者 Huy Hoang Ha, Benoit Favre, Francois Portet
发布日期 2026-05-10
arXiv ID 2605.09661
相关性评分 8/10 (高度相关)