RAG Uncertainty Robustness Biomedical QA Evidence Conflict
摘要

生物医学检索增强大语言模型常面临不完整、误导性或内部矛盾的证据,而现有评估多关注有利上下文下的准确性,忽视冲突下的可靠性。本文利用 HealthContradict 数据集,在五种受控证据条件下评估六个开源模型。研究发现,仅反转矛盾文档顺序即可导致所有模型准确率下降,且 11.4% 至 25.2% 的预测结果发生翻转。为此,提出一种结合模型置信度与证据冲突检测器的“冲突感知弃权分数”。实验表明,在高难度条件下,该策略显著优于仅依赖置信度的方法,有效提升了选择性准确率,揭示了冲突证据带来的不确定性与鲁棒性挑战。

AI 推荐理由

研究 LLM 在证据冲突下的推理鲁棒性与不确定性,虽非纯逻辑推理,但核心涉及判断与决策机制。

研究机构
University of Illinois Urbana-Champaign
论文信息
作者 Yikun Han, Mengfei Lan, Halil Kilicoglu
发布日期 2026-05-13
arXiv ID 2605.14115
相关性评分 8/10 (高度相关)