Medical VLM Spatial Reasoning Visual Grounding Chain-of-Thought
摘要

空间推理与视觉接地是视觉语言模型的核心能力,但现有医疗模型缺乏透明推理与空间证据,且基准多基于孤立 2D 图像,忽视了临床影像的体积特性。本文提出 SGMRI-VQA 基准,包含 41,307 个多帧空间接地问答对,源自放射专家标注,涵盖检测、定位、分类等层级任务,要求模型联合推理内容、位置及跨帧分布。实验表明,对 Qwen3-VL-8B 进行边界框监督微调,显著提升了接地性能,证明了针对性空间监督是实现临床接地推理的有效路径。

AI 推荐理由

论文核心研究多帧空间推理与思维链,提出新基准并验证监督微调对推理能力的提升。

研究机构
Georgia Institute of Technology Harvard University Georgetown University
论文信息
作者 Lama Moukheiber, Caleb M. Yeung, Haotian Xue, Alec Helbling, Zelin Zhao et al.
发布日期 2026-04-17
arXiv ID 2604.15808
相关性评分 9/10 (高度相关)