Multimodal Generation Iterative Planning Interleaved Reasoning
摘要

本文提出过程驱动图像生成范式,将合成任务分解为思维与动作交错的推理轨迹。该方法摒弃单步生成,转而采用包含文本规划、视觉草稿、文本反思及视觉修正的四阶段迭代流程。文本推理明确指导视觉状态演化,生成的中间视觉结果则约束并 grounding 下一轮推理。针对中间状态评估模糊的挑战,研究引入密集分步监督,强制保持视觉时空语义一致性及文本对先验知识的保留与纠错能力,实现了可解释且可直接监督的生成过程。

AI 推荐理由

论文提出多步生成范式,核心在于文本规划与视觉执行的迭代循环,深度契合规划主题。

研究机构
Meta Superintelligence Labs University of California, San Diego
论文信息
作者 Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang et al.
发布日期 2026-04-06
arXiv ID 2604.04746
相关性评分 9/10 (高度相关)