摘要
本文提出过程驱动图像生成范式,将合成任务分解为思维与动作交错的推理轨迹。该方法摒弃单步生成,转而采用包含文本规划、视觉草稿、文本反思及视觉修正的四阶段迭代流程。文本推理明确指导视觉状态演化,生成的中间视觉结果则约束并 grounding 下一轮推理。针对中间状态评估模糊的挑战,研究引入密集分步监督,强制保持视觉时空语义一致性及文本对先验知识的保留与纠错能力,实现了可解释且可直接监督的生成过程。
AI 推荐理由
论文提出多步生成范式,核心在于文本规划与视觉执行的迭代循环,深度契合规划主题。
研究机构
Meta Superintelligence Labs
University of California, San Diego
论文信息