Medical AI Tool Use Benchmark Multimodal Agents
摘要

为使医疗 AI 智能体做出符合临床依据的决策,其需具备工具检索、证据获取与整合能力。现有基准多局限于孤立感知或单轮问答,难以揭示规划与工具调用的失效。本文提出 MedCTA,这是一个基于真实多模态临床输入(如影像、病理切片)且经医生验证的基准,包含 107 项现实临床任务及 5 种部署工具的可执行轨迹。该基准支持对工具选择、参数有效性及执行稳定性的过程感知评估。实验表明,即便前沿模型在多步临床工具使用中仍显脆弱,常出现协议失败与工具误用,证明强大的感知能力并不等同于可靠的智能体行为。

AI 推荐理由

论文核心评估医疗 Agent 的工具检索、选择及执行能力,属于技能学习范畴。

研究机构
King Abdullah University of Science and Technology (KAUST), Saudi Arabia Massachusetts Institute of Technology (MIT), USA
论文信息
作者 Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker, Bernard Ghanem
发布日期 2026-06-10
arXiv ID 2606.11702
相关性评分 9/10 (高度相关)