摘要
指令引导的图像编辑虽进展显著,但在处理小目标、隐式空间关系等简单案例时仍常失败。本文指出失败主因并非模型能力不足,而是任务表述不当。为此,我们提出一种自适应任务重构框架,无需修改底层模型即可提升性能。该方法利用多模态大语言模型智能体,通过分析、路由、重构及反馈驱动的精炼,将原始图像 - 指令对动态转化为一系列操作序列。在多个基准测试及不同编辑骨干模型上的实验表明,该方法显著提升了编辑效果,尤其在复杂案例中增益巨大。
AI 推荐理由
论文核心在于通过智能体动态规划操作序列来重构任务,属于典型的任务规划与分解研究。
研究机构
Nanjing University
China
Beijing Institute of Technology
College of Artificial Intelligence, China University of Petroleum (Beijing)
Beijing University of Posts and Telecommunications
Kuaishou Technology
论文信息