摘要
视频世界模型需在证据缺失时维持状态演化,但现有生成器常在中断时冻结隐藏状态。本文提出 ReMind 框架,通过面向记忆的数据、事件感知训练及缓存适配激发动态记忆行为。构建了包含 100 多种动态事件的分类体系及混合训练数据,将片段转化为含保护锚点和时间间隙的帧图。采用节点结构化课程学习,迫使模型跨中断检索过往状态而非依赖局部连续性。此外,提出 PM-RoPE 扩展以低成本解锁时空检索。实验表明该方法在 STEVO-Bench 上表现最优且避免灾难性遗忘。
AI 推荐理由
论文核心提出动态记忆框架,利用 KV-cache 机制解决视频生成中的状态遗忘问题。
研究机构
Applied Intuition
University of California, Berkeley
论文信息