Multimodal Reasoning Image Editing Agent Framework Tree-of-States Graph-of-References
摘要

现有基于指令的图像编辑模型在处理简单单步指令时表现良好,但在涉及多重、冗长且相互依赖指令的真实场景中性能下降。主要原因是缺乏带有复杂多指令标注的训练数据,而收集此类数据并重新训练模型成本高昂。为此,本文提出 MSRAMIE,一种基于多模态大语言模型(MLLM)的免训练智能体框架。该框架将现有编辑模型作为插件组件,通过结构化多模态推理处理多指令任务。它协调基于 MLLM 的“指导者”与图像编辑“执行者”之间的迭代交互,引入包含“状态树”和“参考图”的新型推理拓扑。在推理过程中,复杂指令被分解为多个编辑步骤,实现状态转换、跨步信息聚合及原始输入回溯,从而系统性地探索图像编辑空间并灵活地逐步优化输出。实验表明,随着指令复杂度增加,MSRAMIE 将指令遵循度提升了 15% 以上,单次运行完成所有修改的概率提高了 100% 以上,同时保持了感知质量和视觉一致性。

AI 推荐理由

提出结构化多模态推理框架,核心创新为树状状态与图状参考拓扑,专注复杂指令下的推理机制。

研究机构
墨尔本大学
论文信息
作者 Zhaoyuan Qiu, Ken Chen, Xiangwei Wang, Yu Xia, Sachith Seneviratne et al.
发布日期 2026-03-17
arXiv ID 2603.16967
相关性评分 9/10 (高度相关)