Multi-Agent System Reinforcement Learning Image Editing Sequential Decision Making
摘要

针对现有图像编辑系统在处理复杂、间接或多步指令时的局限性,本文提出 ImageEdit-R1,一种基于强化学习的多智能体框架。该框架协调多个专用预训练视觉 - 语言及生成智能体,分别负责意图理解、区域识别、动作选择及内容合成。通过将图像编辑视为序列决策问题,利用强化学习管理智能体协作,实现动态且具备上下文感知的编辑策略。实验表明,该方法在多个数据集上均优于闭源扩散模型及其他多智能体基线。

AI 推荐理由

论文将图像编辑建模为序列决策问题,利用多智能体协作与强化学习进行高层规划。

研究机构
新加坡国立大学 Adobe Research
论文信息
作者 Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui
发布日期 2026-03-09
arXiv ID 2603.08059
相关性评分 9/10 (高度相关)