Multimodal Learning Reasoning Context Unrolling Unified Model
摘要

本文提出了 Omni,一种原生训练于文本、图像、视频、3D 几何及隐藏表示等多种模态的统一多模态模型。研究发现,此类训练促成了“上下文展开”现象,即模型在生成预测前能显式地跨多种模态表示进行推理。该过程使模型能够聚合异构模态间的互补信息,从而更忠实地逼近共享的多模态知识流形,并提升下游推理的保真度。结果表明,Omni 在多模态生成与理解基准上表现优异,展现了包括文本、图像、视频及 3D 几何在内的上下文中生成的高级多模态推理能力。

AI 推荐理由

论文核心提出“上下文展开”机制,显式进行多模态推理,显著提升推理保真度。

研究机构
ByteDance
论文信息
作者 Ceyuan Yang, Zhijie Lin, Yang Zhao, Fei Xiao, Hao He et al.
发布日期 2026-04-23
arXiv ID 2604.21921
相关性评分 9/10 (高度相关)