摘要
视频推理分割(VRS)旨在基于隐含人类意图与时序逻辑的指令分割视频目标对象。现有方法常因关键帧选择局限导致时序理解薄弱。为此,本文提出 RCoT-Seg 框架,将任务分解为时序视频推理(TVR)与关键帧目标感知(KTP)。在 TVR 阶段,利用基于思维链启动语料库初始化并经 GRPO 强化的代理模块,通过自我评估生成并重选关键帧,增强时刻定位与时序推理;在 KTP 阶段,对选定帧执行高分辨率分割并传播掩码。实验表明该方法性能优越。
AI 推荐理由
论文核心提出强化思维链框架,显式解耦时序推理与空间感知,显著提升视频推理能力。
研究机构
Harbin Institute of Technology
Pengcheng Laboratory
论文信息