clinical diagnosis interactive evaluation diagnostic reasoning evidence seeking
摘要

大型语言模型在静态医学考试中表现优异,但临床诊断常需在不确定性下进行迭代式证据收集。本文构建了基于 OSCE 的标准化患者模拟器及可控基准,用于评估主动诊断询问能力。通过对 468 个案例和 15 个模型的测试发现,多轮证据寻求使诊断准确率下降 12.75%,支持证据质量降低 24.36%。错误分析表明,这主要归因于过早闭合诊断和低效提问。结果提示静态基准可能高估交互式场景性能,需补充交互评估以提升临床安全性。

AI 推荐理由

论文核心研究 LLM 在不确定性下的诊断推理能力,聚焦证据收集与逻辑推导过程。

研究机构
School of Electronic and Electrical Engineering, Shanghai University of
论文信息
作者 Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma et al.
发布日期 2026-05-21
arXiv ID 2605.22047
相关性评分 9/10 (高度相关)