Video Generation Entity-Centric Memory Consistency Efficient Attention
摘要

多镜头视频生成需在保持实体外观一致性的同时遵循特定镜头提示。现有自回归方法复用全帧作为记忆,导致无关信息泄露且计算成本高。本文提出一种实体索引的潜在补丁记忆库,引入兼容预训练模型的稀疏令牌条件机制,限制自注意力范围以降低成本。此外,设计了结构化脚本格式、预算化记忆更新策略及噪声注入机制,以实现细粒度外观控制并防止信息泄露。该方法显著提升了提示遵循度、效率及主体一致性。

AI 推荐理由

论文核心提出实体中心记忆架构,解决多镜头视频生成中的一致性与效率问题。

研究机构
Max Planck Institute for Informatics, Germany Adobe Research, USA Adobe Research, UK
论文信息
作者 Jente Vandersanden, Matheus Gadelha, Chun-Hao P. Huang, Hyeonho Jeong, Yulia Gryaditskaya
发布日期 2026-05-22
arXiv ID 2605.23610
相关性评分 9/10 (高度相关)