Chain-of-Thought Image Editing Multi-modal Learning Generalization
摘要

统一多模态模型虽通过引入细粒度理解至思维链(CoT)提升了图像编辑性能,但何种 CoT 形式与训练策略能共同增强理解细粒度与泛化性仍待探索。本文提出 Meta-CoT,对单图编辑操作进行两级分解:首先将编辑意图表示为三元组并分解任务与目标,生成特定任务的 CoT;其次将任务拆解为五个基本元任务以实现强泛化。此外,引入 CoT-编辑一致性奖励以对齐推理与行为。实验表明该方法在 21 项任务中整体提升 15.8%,且在少量元任务训练下能有效泛化至未见任务。

AI 推荐理由

论文核心提出 Meta-CoT,通过细粒度思维链分解提升图像编辑中的理解与推理能力。

研究机构
深圳大学 清华大学 腾讯
论文信息
作者 Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He et al.
发布日期 2026-04-27
arXiv ID 2604.24625
相关性评分 9/10 (高度相关)