摘要
基于推理的文本到图像(T2I)生成要求模型准确解读复杂提示。现有方法要么缺乏视觉上下文,要么计算成本高昂且受限于生成器能力。为此,本文提出 StruVis 框架,通过“结构化视觉思维”增强 T2I 生成。该方法不依赖中间图像生成,而是利用基于文本的结构化视觉表示作为中间推理状态,使多模态大模型能在纯文本推理过程中有效“感知”视觉结构。作为与生成器无关的框架,StruVis 可无缝集成多种 T2I 生成器。实验表明,其在 T2I-ReasonBench 和 WISE 基准上分别提升了 4.61% 和 4%。
AI 推荐理由
论文核心提出结构化视觉推理框架,旨在解决复杂提示下的推理生成问题。
研究机构
香港科技大学
上海交通大学
论文信息