跨模态推理 统一模型 潜在空间表示 视觉空间规划
摘要

统一模型在理解与生成异构模态内容方面颇具前景。相较于单纯生成视觉内容,利用统一模型进行交错跨模态推理更具价值,例如解决需密集视觉思维的理解问题、通过自反思改进视觉生成或建模物理世界的视觉动态。然而,现有模型因理解与生成的视觉表示分离,需依赖像素解码作为桥梁,效率低下。本文提出 LatentUM,一种在共享语义潜在空间中表示所有模态的新型统一模型,消除了像素空间中介。该设计不仅提升计算效率,还减轻编码偏差并增强跨模态对齐,在视觉空间规划基准上达到最先进水平,并通过自反思推动视觉生成极限。

AI 推荐理由

论文核心提出潜在空间统一模型以解决交错跨模态推理问题,显著提升推理能力。

研究机构
上海交通大学
论文信息
作者 Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu et al.
发布日期 2026-04-02
arXiv ID 2604.02097
相关性评分 9/10 (高度相关)