论文

I3DM:隐式 3D 感知内存检索和注入,用于生成一致的视频场景

I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation

摘要

尽管视频生成取得了显着进展,但在重新访问先前探索的区域时保持长期场景一致性仍然具有挑战性。现有的解决方案要么依赖于显式构建 3D 几何结构,但会受到误差累积和尺度模糊的影响;要么依赖于简单的相机视场 (FoV) 检索,而这在复杂遮挡下通常会失败。为了克服这些限制,我们提出了 I3DM,这是一种新颖的隐式 3D 感知内存机制,用于绕过显式 3D 重建来生成一致的视频场景。我们方法的核心是 3D 感知记忆检索策略,它利用预先训练的前馈新颖视图合成 (FF-NVS) 模型的中间特征来对视图相关性进行评分,即使在高度遮挡的场景中也能实现稳健的检索。此外,为了充分利用检索到的历史帧,我们引入了 3D 对齐的内存注入模块。该模块隐式地将历史内容扭曲到目标视图,并自适应地调节可靠扭曲区域的生成,从而提高重访一致性和准确的摄像机控制。大量的实验表明,我们的方法优于最先进的方法,实现了卓越的重访一致性、生成保真度和相机控制精度。