Surgical Scene Understanding Multimodal LLM Visual Grounding Structured Reasoning
摘要

针对现有手术场景理解方法碎片化的问题,本文提出 SurgMLLM 框架,利用多模态大语言模型(MLLM)在单一模型中桥接高层推理与低层视觉定位。该方法通过微调 MLLM 支持结构化可解释推理,联合建模手术阶段、器械 - 动词 - 目标三元组及分割令牌,并以此引导分割网络实现像素级定位。我们在扩展的 CholecT45-Scene 数据集上进行端到端训练与评估,实验表明该方法显著提升了三元组识别、阶段识别及分割性能,实现了更可靠的手术辅助。

AI 推荐理由

论文核心在于利用 MLLM 进行结构化推理以桥接视觉定位,推理是关键组件。

研究机构
Southern University of Science and Technology Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Northwestern University University of Alberta Yale University Northwest Hospital
论文信息
作者 Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji et al.
发布日期 2026-05-13
arXiv ID 2605.13530
相关性评分 8/10 (高度相关)