摘要
大型语言模型在单轮医疗诊断中表现优异,但在接近真实临床推理的多轮证据积累场景下的行为尚不明确。本文提出 MINT 基准,包含 1035 个病例,系统评估了 11 个模型。研究发现三种关键行为模式:过早回答倾向、显著的自我修正潜力以及强诱导信息导致的 premature commitment。研究建议将诊断提问推迟至后续轮次,并保留关键临床证据稍后展示,可显著提升诊断准确率与可靠性。
AI 推荐理由
论文核心研究多轮医疗诊断中的推理行为、过早承诺及自我修正机制,属推理能力范畴。
研究机构
The University of Texas at Austin
New York University
University of North Carolina at Chapel Hill
University of Illinois Urbana-Champaign
论文信息