摘要
本文提出了 Omni,一种原生训练于文本、图像、视频、3D 几何及隐藏表示等多种模态的统一多模态模型。研究发现,此类训练促成了“上下文展开”现象,即模型在生成预测前能显式地跨多种模态表示进行推理。该过程使模型能够聚合异构模态间的互补信息,从而更忠实地逼近共享的多模态知识流形,并提升下游推理的保真度。结果表明,Omni 在多模态生成与理解基准上表现优异,展现了包括文本、图像、视频及 3D 几何在内的上下文中生成的高级多模态推理能力。
AI 推荐理由
论文核心提出“上下文展开”机制,显式进行多模态推理,显著提升推理保真度。
研究机构
ByteDance
论文信息