摘要
针对现有手术场景理解方法碎片化的问题,本文提出 SurgMLLM 框架,利用多模态大语言模型(MLLM)在单一模型中桥接高层推理与低层视觉定位。该方法通过微调 MLLM 支持结构化可解释推理,联合建模手术阶段、器械 - 动词 - 目标三元组及分割令牌,并以此引导分割网络实现像素级定位。我们在扩展的 CholecT45-Scene 数据集上进行端到端训练与评估,实验表明该方法显著提升了三元组识别、阶段识别及分割性能,实现了更可靠的手术辅助。
AI 推荐理由
论文核心在于利用 MLLM 进行结构化推理以桥接视觉定位,推理是关键组件。
研究机构
Southern University of Science and Technology
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences
Northwestern University
University of Alberta
Yale University
Northwest Hospital
论文信息