摘要
多轮图像编辑对迭代设计至关重要,但现有模型常面临身份漂移和误差累积问题。本文提出 AnchorEdit,首个基于自回归扩散的高分辨率长程多轮编辑框架。该方法通过三阶段训练课程桥接视频先验与因果推理,并在推理阶段引入记忆机制以锚定初始主体身份,确保长轨迹下的稳定外推。实验表明,即使在超过 10 轮交互中,该模型仍能保持卓越的主题保真度和指令遵循能力。
AI 推荐理由
论文提出因果记忆机制以锚定主体身份,解决多轮编辑中的时序一致性问题,核心贡献在于记忆架构。
研究机构
University of Science and Technology of China
JD Explore Academy
论文信息