摘要
长视界自回归视频生成中保持长期几何一致性极具挑战。现有记忆增强模型依赖相机姿态或显式三维重建,分别存在粒度粗糙或维护成本高的问题。本文提出覆盖最大化检索增强生成(COVRAG),利用预训练三维先验构建目标视图覆盖图作为轻量级三维记忆证据。在帧选择上,该方法通过最大化残差覆盖增益,迭代检索能解释当前上下文未覆盖区域的记忆帧。此外,引入滑动窗口深度缓存以提升长视频生成的可扩展性。实验表明,COVRAG 在保持低延迟的同时显著提升了长程几何一致性。
AI 推荐理由
论文提出基于深度记忆的检索框架,核心解决长视频生成中的记忆选择与几何一致性问题。
研究机构
Korea University
KAIST
论文信息