论文
检索丢失的内容:覆盖最大化检索以生成一致的长视频
Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation
摘要
对于长视野自回归视频生成来说,保持长期的几何一致性仍然是一个挑战。记忆增强生成模型通过检索历史框架来解决这个问题,但其有效性取决于两个关键的设计选择:哪些 3D 几何证据应该代表过去的观察结果,以及如何从这些证据中选择记忆框架。现有方法通常依赖于相机姿态或视场重叠,这些方法很轻量,但太粗糙,无法推理像素级可见性,或者使用显式 3D 重建,它提供细粒度的证据,但长期部署的维护成本高昂。我们提出了覆盖最大化检索增强生成(COVRAG),这是一种基于深度的记忆检索框架,它使用预训练的 3D 先验来构建目标视图覆盖图作为轻量级 3D 记忆证据。对于帧选择,COVRAG 最大化剩余覆盖增益,迭代检索解释当前上下文或先前选择的记忆未覆盖的目标视图区域的帧。为了提高长视频生成的可扩展性,我们引入了滑动窗口深度缓存以实现高效的几何估计。 RealEstate10K 和 DL3DV10K 上的实验表明,COVRAG 提高了长范围几何一致性,同时与基线相比保持了较低的延迟。