论文

需要时记忆:解耦内存控制以实现空间一致的长视野视频生成

Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation

摘要

空间一致的长视距视频生成旨在沿着预定义的摄像机轨迹保持时间和空间的一致性。现有的方法大多将内存建模与视频生成纠缠在一起,导致场景重访期间内容不一致,并且在探索新区域时生成能力下降,甚至在大量带注释的数据上进行训练。为了解决这些限制,我们提出了一个将内存调节与生成分开的解耦框架。我们的方法显着降低了训练成本,同时增强了空间一致性并保留了新场景探索的生成能力。具体来说,我们采用轻量级、独立的记忆分支来从历史观察中学习精确的空间一致性。我们首先引入混合记忆表示来从生成的帧中捕获互补的时间和空间线索,然后利用每帧交叉注意机制来确保每个帧仅以空间上最相关的历史信息为条件,这些信息被注入到生成模型中以确保空间一致性。当生成新场景时,提出了一种相机感知门控机制来调解内存和生成模块之间的交互,仅当存在有意义的历史参考时才启用内存调节。与现有方法相比,我们的方法具有很高的数据效率,但实验表明我们的方法在视觉质量和空间一致性方面都实现了最先进的性能。