摘要
尽管统一的多模态大语言模型具备内在的推理能力,但其在文本到图像生成中的自反思与自优化应用尚不充分。现有方法多依赖整体对齐判断,缺乏对细节属性的细粒度控制。为此,本文提出细粒度多模态推理(FiMR)框架,利用分解式视觉问答将提示词拆解为最小语义单元并逐一验证,生成显式反馈以指导局部优化。实验表明,该方法在组合性基准测试中显著优于现有基线,有效提升了图像与提示词的对齐精度及生成质量。
AI 推荐理由
论文核心提出细粒度多模态推理框架,利用分解式 VQA 进行自我反思与修正。
研究机构
Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea
论文信息