Medical Agents Tool Use Vision-Language Models Clinical Workflow Benchmark
摘要

当前医学影像任务评估过度依赖预筛选的二维图像,忽视了真实临床中代理需主动导航三维体积以收集证据的核心挑战。为此,本文提出 MedOpenClaw,一种可审计运行时,允许视觉语言模型在标准医疗工具(如 3D Slicer)中动态操作。基于此,我们引入 MedFlowBench,涵盖多序列脑部 MRI 和肺部 CT/PET 的全量研究基准。研究发现,尽管先进模型能完成基础导航,但因缺乏精确空间定位能力,使用专业工具时性能反而下降。该工作为开发可审计的全量医学影像代理奠定了基础。

AI 推荐理由

论文核心在于构建可审计运行时,使 Agent 能动态操作专业医疗工具进行诊断,属技能学习。

研究机构
Technical University of Munich (TUM) National University of Singapore TUM University Hospital LMU Munich Carnegie Mellon University Imperial College London University of Oxford Munich Center for Machine Learning
论文信息
作者 Weixiang Shen, Yanzhu Hu, Che Liu, Junde Wu, Jiayuan Zhu et al.
发布日期 2026-03-25
arXiv ID 2603.24649
相关性评分 9/10 (高度相关)