Medical Agents Benchmark Workflow Evaluation Long-horizon Tasks
摘要

针对现有医学智能体基准仅评估最终输出而缺乏过程洞察的问题,本文提出 AutoMedBench。这是一个感知工作流的基准,涵盖医学影像与多模态推理任务,将智能体执行统一划分为规划、设置、验证、推理和提交五个阶段。该基准包含长程任务,平均每个运行涉及 33 个智能体回合,并设有不同难度层级。通过分阶段评分发现,当前智能体在“验证”阶段表现最弱,而在“设置”阶段最强,表明其更擅长构建可执行流程而非验证可靠性,且验证与提交错误是主要失败原因。

AI 推荐理由

论文核心提出五阶段工作流基准,重点评估智能体的任务规划与多步执行能力。

研究机构
University of California, Santa Cruz NVIDIA
论文信息
作者 Junqi Liu, Salena Song, Yuhan Wang, Jiawei Mao, Hardy Chen et al.
发布日期 2026-06-01
arXiv ID 2606.01961
相关性评分 9/10 (高度相关)