Visual Generation Self-Critique LLM Reasoning Diffusion Models
摘要

文本到图像生成虽已统一架构,但系统在合成复杂提示时仍常失败,尽管其验证能力准确。本文将此形式化为“理解 - 生成差距”,并提出 UniReasoner 框架,利用大语言模型作为通用推理器,将其理解优势转化为直接生成指导。该方法先生成粗略视觉草稿,再进行自我批判以产生基于事实的文本评估,指出需修正之处。最终,扩散模型联合条件于提示、草稿及评估,确保生成过程由明确的修正信号引导,显著提升了组合对齐与语义忠实度。

AI 推荐理由

论文核心提出利用 LLM 作为通用推理器,通过自我批判和评估机制解决视觉生成中的理解 - 生成差距。

研究机构
Johns Hopkins University Apple
论文信息
作者 Sucheng Ren, Chen Chen, Zhenbang Wang, Liangchen Song, Xiangxin Zhu et al.
发布日期 2026-05-05
arXiv ID 2605.04040
相关性评分 9/10 (高度相关)