medical diagnosis multi-turn reasoning self-correction benchmark
摘要

大型语言模型在单轮医疗诊断中表现优异,但在接近真实临床推理的多轮证据积累场景下的行为尚不明确。本文提出 MINT 基准,包含 1035 个病例,系统评估了 11 个模型。研究发现三种关键行为模式:过早回答倾向、显著的自我修正潜力以及强诱导信息导致的 premature commitment。研究建议将诊断提问推迟至后续轮次,并保留关键临床证据稍后展示,可显著提升诊断准确率与可靠性。

AI 推荐理由

论文核心研究多轮医疗诊断中的推理行为、过早承诺及自我修正机制,属推理能力范畴。

研究机构
The University of Texas at Austin New York University University of North Carolina at Chapel Hill University of Illinois Urbana-Champaign
论文信息
作者 Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu et al.
发布日期 2026-04-06
arXiv ID 2604.04325
相关性评分 9/10 (高度相关)