Multimodal Reasoning Chain-of-Thought Image Segmentation MLLM
摘要

推理分割旨在通过联合视觉 - 文本推理,分割由复杂语言描述的目标对象。现有方法常依赖语义令牌或显式空间提示,存在跨模态对齐困难或丢失整体语义的问题。为此,本文提出 CR-Seg,一种由粗到精的两阶段推理分割框架。该框架设计了提取注意力图与关键点模块(EAP),用于粗略定位并选取信息点以辅助 SAM 细化掩码;同时引入全局到局部思维链(GLCoT),引导模型从全局场景上下文逐步推理至局部目标细节,有效缓解推理与答案的不一致性。实验证明了该方法的有效性。

AI 推荐理由

论文提出基于思维链(CoT)的推理分割框架,核心解决多模态推理一致性问题。

研究机构
东北大学软件学院
论文信息
作者 Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang et al.
发布日期 2026-06-02
arXiv ID 2606.03564
相关性评分 9/10 (高度相关)