Multimodal Models Chain-of-Thought Reflective Rectification Visual Reasoning
摘要

统一多模态模型旨在整合视觉理解与生成,但存在理解能力显著优于生成能力的错配问题。受人类“边想边画”范式启发,本文提出 UniRect-CoT,一种无需训练的统一修正思维链框架。该方法利用模型固有的强大理解能力作为自监督信号,在扩散去噪这一内在视觉推理过程中持续反思并修正中间结果,使其与指令对齐。实验表明,该框架能显著提升现有模型在复杂任务中的生成质量。

AI 推荐理由

提出基于思维链的反射修正框架,将去噪过程视为视觉推理,核心提升推理与生成一致性。

研究机构
Zhejiang University
论文信息
作者 Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai et al.
发布日期 2026-04-15
arXiv ID 2604.13540
相关性评分 9/10 (高度相关)