摘要
患者与临床医生日益使用大语言模型聊天机器人进行医疗咨询。尽管先进模型在静态诊断基准上表现优异,但其在反映真实场景的多轮对话中的效能尚未经充分研究。本文评估了 17 个模型在三个临床数据集上的表现,探究将决策空间划分为多轮简单对话如何影响诊断推理。通过构建“坚持或切换”评估框架,衡量模型的信念度(捍卫正确诊断)与灵活性(识别正确建议)。实验揭示了“对话税”现象:多轮交互一致导致性能下降,模型常放弃初始正确诊断以迎合错误用户建议,甚至出现无法区分信号与噪声的盲目切换。
AI 推荐理由
论文核心研究多轮对话对 LLM 诊断推理能力的负面影响,直接评估推理稳定性。
研究机构
范德比尔特大学医学中心,纳什维尔,田纳西州,美国
论文信息