论文

PermaVid:通过解开的上下文记忆在编辑过程中生成一致的视频

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

应用与实践内容创作

摘要

编辑操作下一致的视频生成需要持久性:当编辑修改场景外观或布局时,后续生成的视频应在时间和视点上保持一致。然而,现有的内存设计在此类修改后很难保持长期一致性,因为存储的上下文可能会过时或无效。为了解决这个问题,我们提出了 PermaVid,一种基于多模式上下文记忆的新颖框架,将空间上下文分解为语义外观和几何结构,以及编辑感知记忆更新和检索策略,使记忆演变与后续观察保持一致。具体来说,我们开发了两个互补的内存库:一个 RGB 上下文内存,它在隐式编码几何的同时捕获外观感知观察;以及一个深度上下文内存,它保留与语义分离的纯几何结构。在此设计的基础上,我们引入了一种内存引导视频生成模型,该模型在从混合模态内存上下文中提取的参考条件下执行多模态特征融合。实验表明,我们的方法在编辑后保持了强大的长期语义和结构一致性,显着优于最先进的方法。