Video Generation Dynamic Memory KV-Cache World Models
摘要

视频世界模型需在证据缺失时维持状态演化,但现有生成器常在中断时冻结隐藏状态。本文提出 ReMind 框架,通过面向记忆的数据、事件感知训练及缓存适配激发动态记忆行为。构建了包含 100 多种动态事件的分类体系及混合训练数据,将片段转化为含保护锚点和时间间隙的帧图。采用节点结构化课程学习,迫使模型跨中断检索过往状态而非依赖局部连续性。此外,提出 PM-RoPE 扩展以低成本解锁时空检索。实验表明该方法在 STEVO-Bench 上表现最优且避免灾难性遗忘。

AI 推荐理由

论文核心提出动态记忆框架,利用 KV-cache 机制解决视频生成中的状态遗忘问题。

研究机构
Applied Intuition University of California, Berkeley
论文信息
作者 Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau et al.
发布日期 2026-05-25
arXiv ID 2605.25333
相关性评分 9/10 (高度相关)