摘要
针对现有图像编辑系统在处理复杂、间接或多步指令时的局限性,本文提出 ImageEdit-R1,一种基于强化学习的多智能体框架。该框架协调多个专用预训练视觉 - 语言及生成智能体,分别负责意图理解、区域识别、动作选择及内容合成。通过将图像编辑视为序列决策问题,利用强化学习管理智能体协作,实现动态且具备上下文感知的编辑策略。实验表明,该方法在多个数据集上均优于闭源扩散模型及其他多智能体基线。
AI 推荐理由
论文将图像编辑建模为序列决策问题,利用多智能体协作与强化学习进行高层规划。
研究机构
新加坡国立大学
Adobe Research
论文信息