摘要
现代图像编辑模型虽能生成逼真结果,但在处理抽象多步指令时表现不佳。现有基于代理的方法依赖手工流程或教师模仿,限制了灵活性。本文提出一种面向长程图像编辑的体验式框架:规划器生成结构化原子分解,编排器选择工具与区域执行步骤。视觉语言评判器提供基于结果的奖励以优化执行,成功轨迹用于 refine 规划器。该方法通过紧密耦合规划与奖励驱动执行,实现了比单步或规则基线更连贯可靠的编辑效果。
AI 推荐理由
论文核心提出规划器与编排器框架,专注于多步图像编辑的任务分解与执行规划。
研究机构
University of Wisconsin-Madison, WI, USA
论文信息