摘要
本文提出 PhysicianBench,这是一个基于真实电子健康记录(EHR)环境的基准,旨在评估 LLM 智能体执行医生任务的能力。现有基准多关注静态知识或单步动作,无法捕捉真实临床系统中的长程复合工作流。该基准包含 100 个源自真实会诊案例的长程任务,涵盖 21 个专科,平均每个任务需 27 次工具调用。任务涉及跨就诊数据检索、异构信息推理及临床文档生成,并通过结构化检查点进行执行级验证。实验显示当前模型在真实临床工作流需求下表现仍有显著差距。
AI 推荐理由
论文聚焦长程复合工作流与任务分解,核心评估 Agent 在复杂临床场景下的多步规划能力。
研究机构
Stanford University
论文信息