摘要
现有分割模型多依赖目标指代指令,难以处理仅描述预期结果的高层意图指令。为此,本文提出 SegWorld 框架,引入多级视觉思维链(CoT)机制。模型在接收指令前主动观察场景,推断物体及其支持的事件;收到指令后,沿“相关物体 - 满足动作 - 物理交互点”链条进行推理,定位具备供能属性的物体部分。该方法将分割形式化为概率推断,利用主动观察提供的语境提升意图级指令下的掩码预测性能。实验表明,其在意图级任务上显著优于基线。
AI 推荐理由
论文核心提出视觉思维链(Visual CoT)机制,通过多步推理将高层意图映射到具体操作区域。
研究机构
Northwestern University
Northeastern University
South China University of Technology
Hong Kong Baptist University
Beijing Normal - Hong Kong Baptist University
论文信息