Multi-Agent Medical Diagnosis Interactive Reasoning Benchmark
摘要

大型语言模型在健康决策支持中应用日益广泛,但现有评估多基于信息完整的单次任务,偏离了临床实践中通过针对性提问进行顺序假设细化的交互式诊断模式。为此,本文构建了包含 20 个专科、4421 个病例的大规模基准 MeDxBench,并提出 MeDxAgent,一个用于交互式诊断的多智能体咨询系统。研究系统分析了提示、流程及智能体层面的设计选择。结果显示,MeDxAgent 在基准上准确率提升 10.3%,缩小了与全知预言机 52.3% 的差距。研究发现,结合人口统计收集、对话摘要传递及候选诊断反馈等设计能显著提升准确性,有效模拟了医生的推理过程。

AI 推荐理由

论文核心研究多智能体交互诊断中的假设细化与推理机制,模拟医生思维过程。

研究机构
Microsoft Research India Institute of AI and Innovation, AIG Hospitals
论文信息
作者 Akshat Sanghvi, Naren Akash, Raza Imam, Amit Sharma, Mohit Jain
发布日期 2026-06-02
arXiv ID 2606.03416
相关性评分 9/10 (高度相关)