摘要
现有图像编辑方法在复杂场景下难以精准定位编辑区域。为此,本文提出生成式视觉思维链(GVCoT),一种统一框架,通过先生成空间线索定位目标区域再执行编辑,实现原生视觉推理。不同于仅依赖文本或工具的思维链,GVCoT 端到端联合优化推理与编辑阶段的视觉令牌,激发内在空间推理能力。针对训练数据稀缺问题,构建了包含 180 万样本的 GVCoT-Edit-Instruct 数据集,并采用监督微调结合强化学习的渐进式训练策略。实验表明,该方法在 SREdit-Bench 等新基准上优于最先进模型。
AI 推荐理由
论文提出生成式视觉思维链,核心在于通过生成空间线索进行原生视觉推理,显著提升编辑精度。
研究机构
北京邮电大学
腾讯混元
论文信息