论文
视频世界模型的潜在空间记忆
Latent Spatial Memory for Video World Models
摘要
在生成的帧之间保持 3D 空间一致性的视频世界模型通常依赖于在 RGB 空间中构建的显式点云内存。这种设计的计算成本很高,需要重复渲染和 VAE 编码,而且本质上是有损耗的,因为像素空间的往返会丢弃所学习的潜在表示的丰富特征。在本文中,我们为视频世界模型引入了 \emph{潜在空间记忆},这是一种持久的 3D 缓存,可直接将场景信息存储在扩散潜在空间中,避免像素空间重建。在此基础上,我们提出了 Mirage,一种潜在空间空间记忆框架,它通过深度引导的反投影将潜在标记提升为 3D 来构建记忆,并通过直接潜在空间扭曲合成新颖的视图来查询它。这种统一的公式消除了像素空间重建的信息损失以及重复编码和渲染的计算负担。实验表明,相对于显式 3D 基线,潜在空间内存可将端到端视频生成速度提高 \textbf{10.57}$\times$,并减少 \textbf{55}$\times$ 内存占用。利用扩散模型的几何先验,Mirage 在 WorldScore 上获得了最先进的性能,并在 RealEstate10K 上获得了强大的重建质量。