Video Reasoning Chain-of-Thought Reinforcement Learning Video Segmentation
摘要

视频推理分割(VRS)旨在基于隐含人类意图与时序逻辑的指令分割视频目标对象。现有方法常因关键帧选择局限导致时序理解薄弱。为此,本文提出 RCoT-Seg 框架,将任务分解为时序视频推理(TVR)与关键帧目标感知(KTP)。在 TVR 阶段,利用基于思维链启动语料库初始化并经 GRPO 强化的代理模块,通过自我评估生成并重选关键帧,增强时刻定位与时序推理;在 KTP 阶段,对选定帧执行高分辨率分割并传播掩码。实验表明该方法性能优越。

AI 推荐理由

论文核心提出强化思维链框架,显式解耦时序推理与空间感知,显著提升视频推理能力。

研究机构
Harbin Institute of Technology Pengcheng Laboratory
论文信息
作者 Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei
发布日期 2026-05-08
arXiv ID 2605.07334
相关性评分 9/10 (高度相关)