摘要
计算机使用智能体可自动化重复性临床屏幕操作,但其在医疗图形用户界面中的可靠性尚未得到充分验证。现有基准多关注通用任务,缺乏对需领域知识且 UI 独特的医疗软件的代表性。本文提出 MedCUA-Bench,一个交互式临床智能体基准,涵盖 10 个医疗领域的 18 个场景,重构自真实手册与开源系统以还原真实界面。任务设有意图与步骤级目标,分离临床推理与界面执行,并通过确定性检查器评估任务完成度及五个临床安全维度。实验显示当前智能体在真实环境中表现不佳,揭示了可靠临床应用间的巨大差距。
AI 推荐理由
论文核心评估 Agent 在医疗 GUI 中的工具使用与操作技能,属技能学习范畴。
研究机构
Microsoft Research Asia, Shanghai, China
Digital Medical Research Center, School of Basic Medical Sciences, Fudan University, Shanghai, China
Shanghai Key Laboratory of MICCAI, Shanghai, China
论文信息