论文

用于视频扩散模型的潜在压缩变分自动编码器

Latent-Compressed Variational Autoencoder for Video Diffusion Models

模型优化模型压缩

摘要

潜在扩散模型中使用的视频变分自动编码器(VAE)通常需要足够多的潜在通道以确保高质量的视频重建。然而,最近的研究表明,即使重建质量仍然很高,过多的潜在通道也会阻碍潜在扩散模型的收敛并降低其生成性能。我们提出了一种潜在压缩方法,该方法可以去除视频潜在表示中的高频分量,而不是直接减少通道数量,这通常会损害重建保真度。实验结果表明,与强基线相比,所提出的方法在保持相同的整体压缩比的同时实现了卓越的视频重建质量。