LLM Agents Medical Benchmark Task Planning EHR Environment
摘要

本文提出 PhysicianBench,这是一个基于真实电子健康记录(EHR)环境的基准,旨在评估 LLM 智能体执行医生任务的能力。现有基准多关注静态知识或单步动作,无法捕捉真实临床系统中的长程复合工作流。该基准包含 100 个源自真实会诊案例的长程任务,涵盖 21 个专科,平均每个任务需 27 次工具调用。任务涉及跨就诊数据检索、异构信息推理及临床文档生成,并通过结构化检查点进行执行级验证。实验显示当前模型在真实临床工作流需求下表现仍有显著差距。

AI 推荐理由

论文聚焦长程复合工作流与任务分解,核心评估 Agent 在复杂临床场景下的多步规划能力。

研究机构
Stanford University
论文信息
作者 Ruoqi Liu, Imran Q. Mohiuddin, Austin J. Schoeffler, Kavita Renduchintala, Ashwin Nayak et al.
发布日期 2026-05-04
arXiv ID 2605.02240
相关性评分 9/10 (高度相关)