Image Editing Agent Planning Multi-step Reasoning Reinforcement Learning
摘要

现代图像编辑模型虽能生成逼真结果,但在处理抽象多步指令时表现不佳。现有基于代理的方法依赖手工流程或教师模仿,限制了灵活性。本文提出一种面向长程图像编辑的体验式框架:规划器生成结构化原子分解,编排器选择工具与区域执行步骤。视觉语言评判器提供基于结果的奖励以优化执行,成功轨迹用于 refine 规划器。该方法通过紧密耦合规划与奖励驱动执行,实现了比单步或规则基线更连贯可靠的编辑效果。

AI 推荐理由

论文核心提出规划器与编排器框架,专注于多步图像编辑的任务分解与执行规划。

研究机构
University of Wisconsin-Madison, WI, USA
论文信息
作者 Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee
发布日期 2026-05-14
arXiv ID 2605.15181
相关性评分 9/10 (高度相关)