Spatial Reasoning Medical MLLM Benchmark Agentic Pipeline 3D Imaging
摘要

视觉空间智能对医学图像解读至关重要,但在针对 3D 成像的多模态大语言模型(MLLM)中尚未得到充分探索。本研究提出一种代理流水线,通过协调体积和距离计算器等计算工具,结合多智能体协作与放射科专家验证,自主合成空间视觉问答数据。我们推出了 SpatialMed,这是首个评估医学 MLLM 三维空间智能的综合基准,包含近一万组涵盖多种器官和肿瘤类型的问答对。对 14 个最先进模型的评估表明,当前模型在医学成像领域缺乏鲁棒的空间推理能力。

AI 推荐理由

论文核心评估 MLLM 在医学影像中的 3D 空间推理能力,揭示其推理缺陷。

研究机构
中国科学院 清华大学 北京大学 浙江大学 上海交通大学 复旦大学 南京大学 中山大学 华中科技大学 西安交通大学
论文信息
作者 Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li et al.
发布日期 2026-03-14
arXiv ID 2603.13800
相关性评分 9/10 (高度相关)