摘要
现有推理基准多基于清洁输入,本文评估推理前的关键步骤:在包含否定、时态及归属混淆的真实电子病历中进行检索。提出 EpiKG,为知识图谱事实添加断言标签与时态标记,并按问题意图路由检索。构建 ClinicalBench 基准,涵盖 43 名患者的 400 个问题。实验显示,相比密集检索基线,该方法在六种大模型上显著提升准确率(+8.84%),且医生评审发现自动生成的参考答案存在高缺陷率,强调人工评审必要性。
AI 推荐理由
论文聚焦临床 QA 中推理前的检索环节,通过增强事实断言提升最终推理准确性。
研究机构
Department of Clinical Sciences, College of Medicine, University of Central Florida, Orlando, FL 32816
论文信息