Video Generation Retrieval-Augmented Generation Geometric Consistency 3D Memory
摘要

长视界自回归视频生成中保持长期几何一致性极具挑战。现有记忆增强模型依赖相机姿态或显式三维重建,分别存在粒度粗糙或维护成本高的问题。本文提出覆盖最大化检索增强生成(COVRAG),利用预训练三维先验构建目标视图覆盖图作为轻量级三维记忆证据。在帧选择上,该方法通过最大化残差覆盖增益,迭代检索能解释当前上下文未覆盖区域的记忆帧。此外,引入滑动窗口深度缓存以提升长视频生成的可扩展性。实验表明,COVRAG 在保持低延迟的同时显著提升了长程几何一致性。

AI 推荐理由

论文提出基于深度记忆的检索框架,核心解决长视频生成中的记忆选择与几何一致性问题。

研究机构
Korea University KAIST
论文信息
作者 Minseok Joo, Dogyun Park, Taehoon Lee, Kyujin Lee, Hyunwoo J. Kim
发布日期 2026-06-01
arXiv ID 2606.02479
相关性评分 9/10 (高度相关)