论文
超越像素:从视频先验到 4D 世界
Beyond Pixels: From Video Priors to 4D Worlds
摘要
4D 生成根据文本或图像等条件合成动态 3D 场景。现有方法要么使用单独的 4D 模型重建生成的 RGB 视频,要么采用特定的视频生成器来直接预测几何。前者会遭受分布不匹配和错误传播的影响,而后者将 4D 预测与特定生成器联系起来,并且当生成器或调节机制发生变化时可能需要重新训练。我们询问共享变分自动编码器 (VAE) 的视频模型的最终去噪潜伏是否可以为显式 4D 预测提供可重用的接口。基于这一见解,我们引入了直接 Latent-to-4D 生成并将其实例化为 Latent-to-4D,它通过将视频潜在与预训练的 4D 解码器的词元网格对齐并通过逐帧和全局时空注意力对其进行细化来绕过 RGB。在大约 1K 个现有重建剪辑上进行训练后,单个检查点在同一 VAE 系列内的多个视频扩散 Transformer 上传输不变。在 Text4D-200 和 I4D-200 上,Latent-to-4D 分别超过基于投影的 DINO-F1 中匹配的相同潜在 Wan+4RC 级联 2.88--3.45 和 5.81 分,同时在几何形状、时间稳定性和整体质量方面也受到人类评估者的青睐。