摘要
本文提出 Bernini 框架,统一多模态大语言模型(MLLM)与扩散模型进行视频生成与编辑。该框架采用分工策略:MLLM 作为规划器在 ViT 嵌入空间预测目标语义表示,扩散模型则据此渲染像素。通过引入思维链推理增强规划器理解力,并设计分段感知 3D 旋转位置编码处理多视觉输入。该方法实现了组件解耦训练,在多项基准测试中达到最先进水平,展现了强大的泛化能力。
AI 推荐理由
论文核心提出基于 MLLM 的语义规划器,直接预测潜在空间表示以指导视频生成,规划是主要贡献。
研究机构
ByteDance
论文信息