论文
闭环一致性:无需训练,保持自回归生成渲染的重访外观
Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering
摘要
最近的条件视频生成模型显示出将 3D 引擎渲染(例如深度图和无纹理几何体)转换为用于游戏和沉浸式内容创建的逼真视频的巨大潜力。这些应用程序需要长视野自回归生成,不断合成新帧,同时保留持久的 3D 世界。自回归生成器使用有界 KV 缓存逐块合成视频,因此当相机在其上下文被逐出后重新访问某个位置时,模型通常会重新生成不一致的外观,即使调节渲染(例如深度)与底层几何图形保持完美对齐。我们通过利用 3D 引擎已经提供的对应关系,在没有任何 后训练 的情况下解决了这种重访不一致的问题:时间对应将姿势匹配的历史潜在块检索到 KV 缓存中作为闭环内存,而来自相机姿势和深度重投影的空间对应将 词元级 的注意力偏向于检索到的块的几何对应区域。我们在从 TartanAir 和 TartanGround 数据集挖掘的闭环轨迹上展示了我们的方法,以反映复杂的现实应用场景,它在重访一致性方面优于现有的 无需训练 基线,而不会损失整体视频质量。项目页面:https://wenchao-m.github.io/ClosetheLoop.github.io/