摘要
视觉空间智能对医学图像解读至关重要,但在针对 3D 成像的多模态大语言模型(MLLM)中尚未得到充分探索。本研究提出一种代理流水线,通过协调体积和距离计算器等计算工具,结合多智能体协作与放射科专家验证,自主合成空间视觉问答数据。我们推出了 SpatialMed,这是首个评估医学 MLLM 三维空间智能的综合基准,包含近一万组涵盖多种器官和肿瘤类型的问答对。对 14 个最先进模型的评估表明,当前模型在医学成像领域缺乏鲁棒的空间推理能力。
AI 推荐理由
论文核心评估 MLLM 在医学影像中的 3D 空间推理能力,揭示其推理缺陷。
研究机构
中国科学院
清华大学
北京大学
浙江大学
上海交通大学
复旦大学
南京大学
中山大学
华中科技大学
西安交通大学
论文信息