摘要
语言引导分割突破了传统语义分割的范围限制。现有方法通常依赖大规模训练以弥补多模态大模型空间定位能力的不足,且推理多局限于纯文本域。本文提出 Seg-Agent,一种完全免训练的框架,首创显式多模态思维链推理。该方法构建包含生成、选择和精炼三阶段的交互式视觉推理循环,利用标记集(SoM)视觉提示将候选区域直接渲染至图像,使模型能在视觉域而非仅文本域迭代推理空间关系。实验表明,该方法无需参数更新即可达到最先进训练方法的性能,并提出了 Various-LangSeg 新基准以评估其泛化能力。
AI 推荐理由
论文提出显式多模态思维链推理机制,核心在于视觉与文本交互的推理循环。
研究机构
中国
论文信息