摘要
为使医疗 AI 智能体做出符合临床依据的决策,其需具备工具检索、证据获取与整合能力。现有基准多局限于孤立感知或单轮问答,难以揭示规划与工具调用的失效。本文提出 MedCTA,这是一个基于真实多模态临床输入(如影像、病理切片)且经医生验证的基准,包含 107 项现实临床任务及 5 种部署工具的可执行轨迹。该基准支持对工具选择、参数有效性及执行稳定性的过程感知评估。实验表明,即便前沿模型在多步临床工具使用中仍显脆弱,常出现协议失败与工具误用,证明强大的感知能力并不等同于可靠的智能体行为。
AI 推荐理由
论文核心评估医疗 Agent 的工具检索、选择及执行能力,属于技能学习范畴。
研究机构
King Abdullah University of Science and Technology (KAUST), Saudi Arabia
Massachusetts Institute of Technology (MIT), USA
论文信息