论文
Robust Dreamer:用于动作控制 AR 视频生成的偏差感知潜在高斯内存
Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation
摘要
逐帧动作控制的图像到视频生成是交互式世界模拟的一个有前途的范例,其中每个控制信号都应引起立即的视觉响应。然而,在长期自回归轨迹采样过程中保持视觉保真度和 3D 一致性仍然具有挑战性。现有的 3D 感知方法经常由于两个障碍而遭受灾难性的漂移:\textit{Latent--RGB Cycling} 中的信息丢失,其中生成的潜在变量被重复解码为 RGB 并重新编码以供将来调节;以及 \textit{无错误假设} 引起的训练推理间隙,其中干净的训练内存无法匹配预测损坏的推理内存。为了应对这些挑战,我们提出了 \textbf{Robust Dreamer},这是一个围绕如何设计 3D 内存以及如何稳健地使用它而构建的内存增强框架。首先,我们引入 \textbf{潜在高斯记忆},它将从生成过程继承的扩散潜伏锚定到高斯基元,并通过潜在空间高斯分布来回忆它们。这提供了密集的、几何感知的、视图对齐的调节,同时避免了重复 VAE 转换带来的累积退化。其次,我们提出了 \textbf{带有动态偏差存档的偏差学习},它通过一步逼近合成 rollout 引起的潜在偏差,通过自回归阶段和去噪时间戳存储它们,并在训练期间将它们注入历史内存中。这使生成器暴露于现实的损坏的内存状态,并在推理之前教导内部校正。 ScanNet、DL3DV 和 OmniWorldGame 上的实验展示了最先进的长视野性能。