Text-to-Image Structured Reasoning Multimodal LLM
摘要

基于推理的文本到图像(T2I)生成要求模型准确解读复杂提示。现有方法要么缺乏视觉上下文,要么计算成本高昂且受限于生成器能力。为此,本文提出 StruVis 框架,通过“结构化视觉思维”增强 T2I 生成。该方法不依赖中间图像生成,而是利用基于文本的结构化视觉表示作为中间推理状态,使多模态大模型能在纯文本推理过程中有效“感知”视觉结构。作为与生成器无关的框架,StruVis 可无缝集成多种 T2I 生成器。实验表明,其在 T2I-ReasonBench 和 WISE 基准上分别提升了 4.61% 和 4%。

AI 推荐理由

论文核心提出结构化视觉推理框架,旨在解决复杂提示下的推理生成问题。

研究机构
香港科技大学 上海交通大学
论文信息
作者 Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang et al.
发布日期 2026-03-06
arXiv ID 2603.06032
相关性评分 9/10 (高度相关)