论文

V-RAE:重新思考视频潜在空间的生成

V-RAE: Rethinking Video Latent Spaces for Generation

模型架构新型架构

摘要

潜在视频生成依赖于自动编码器来定义生成模型运行的紧凑空间。尽管视频自动编码器架构已经有了很大的发展,但它们的潜在空间仍然主要针对像素级重建进行优化,并提供有限的高级语义组织。然而,重建最佳的潜在空间不一定非常适合生成建模。我们提出了 V-RAE,一种视频表示自动编码器,它在冻结视觉基础模型表示之上构建紧凑的生成潜伏。轻量级时间池模块在保留语义结构的同时消除时间冗余,视频解码器从压缩特征中重建连续运动。我们使用四种代表性的冻结编码器在视频重建、语义探测和类条件生成方面评估 V-RAE。 V-RAE 在 K600 上实现了 2.13 rFVD,优于所有评估的大规模预训练视频 VAE。与传统的视频分词器潜在变量相比,它的潜在变量保留了更多的语义信息。在匹配的生成设置下,我们的最佳变体在 UCF101 和 K600 上分别实现了 117.86 和 19.16 的 gFVD 分数,同时收敛速度提高了 6 倍}。我们进一步表明,仅重建质量不足以表征生成效用,并引入了 tFVD,这是一种与下游生成质量更可靠相关的时间相干诊断。除了视频生成之外,V-RAE 还改进了匹配预测设置下在 Wan 2.2 VAE 潜在空间上对城市景观的未来视频预测。总而言之,实验表明冻结语义表示可以支持视频重建、生成和预测建模。项目页面:https://v-rae.github.io/。