infinite video generation evolving memory autoregressive model video diffusion transformer
摘要

本文提出 Echo-Infinity,一种用于实时无限视频生成的自回归框架,采用可学习的演化记忆动态过滤、抽象并压缩任意长度历史,且计算成本恒定。受人类记忆巩固启发,该方法用可学习的记忆查询替代手工设计的记忆管理,通过注意力与门控机制更新,并与视频扩散 Transformer 端到端优化。此外,引入统一相对 RoPE 方案消除训练与推理间的位置编码外推差距。实验表明其在长短视频生成中达到最先进水平,首次实现超 24 小时的实时 rollout。

AI 推荐理由

论文核心提出可学习演化记忆机制,动态压缩历史以支持无限视频生成,属记忆架构研究。

研究机构
The Chinese University of Hong Kong Jingdong Future Academy Tsinghua University Peking University University of Science and Technology of China
论文信息
作者 Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin et al.
发布日期 2026-06-03
arXiv ID 2606.04527
相关性评分 9/10 (高度相关)