Video Generation Semantic Planning Multimodal LLM Diffusion Models
摘要

本文提出 Bernini 框架,统一多模态大语言模型(MLLM)与扩散模型进行视频生成与编辑。该框架采用分工策略:MLLM 作为规划器在 ViT 嵌入空间预测目标语义表示,扩散模型则据此渲染像素。通过引入思维链推理增强规划器理解力,并设计分段感知 3D 旋转位置编码处理多视觉输入。该方法实现了组件解耦训练,在多项基准测试中达到最先进水平,展现了强大的泛化能力。

AI 推荐理由

论文核心提出基于 MLLM 的语义规划器,直接预测潜在空间表示以指导视频生成,规划是主要贡献。

研究机构
ByteDance
论文信息
作者 Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi et al.
发布日期 2026-05-21
arXiv ID 2605.22344
相关性评分 9/10 (高度相关)