Multimodal Reasoning Text-to-Image Generation Self-Reflection Fine-grained Control
摘要

尽管统一的多模态大语言模型具备内在的推理能力,但其在文本到图像生成中的自反思与自优化应用尚不充分。现有方法多依赖整体对齐判断,缺乏对细节属性的细粒度控制。为此,本文提出细粒度多模态推理(FiMR)框架,利用分解式视觉问答将提示词拆解为最小语义单元并逐一验证,生成显式反馈以指导局部优化。实验表明,该方法在组合性基准测试中显著优于现有基线,有效提升了图像与提示词的对齐精度及生成质量。

AI 推荐理由

论文核心提出细粒度多模态推理框架,利用分解式 VQA 进行自我反思与修正。

研究机构
Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea
论文信息
作者 Yongjin Kim, Yoonjin Oh, Yerin Kim, Hyomin Kim, Jeeyoung Yun et al.
发布日期 2026-04-15
arXiv ID 2604.13491
相关性评分 9/10 (高度相关)