论文
具有预测潜伏的视频生成
Video Generation with Predictive Latents
摘要
视频变分自动编码器(VAE)通过将视觉世界映射到紧凑的时空潜在空间中来实现潜在视频生成建模,从而提高训练效率和稳定性。虽然现有的视频 VAE 实现了值得称赞的重建质量,但重建的持续优化并不一定会转化为生成性能的提高。如何增强视频潜伏的可扩散性仍然是一个关键且尚未解决的挑战。在这项工作中,受预测世界建模原理的启发,我们研究了预测学习在改进视频生成建模方面的潜力。为此,我们引入了一种简单有效的预测重建目标,它将预测学习与视频重建结合起来。具体来说,我们随机丢弃未来的帧并仅对过去的部分观察进行编码,同时训练解码器重建观察到的帧并同时预测未来的帧。这种设计鼓励潜在空间对时间预测结构进行编码,并建立对视频动态的更连贯的理解,从而提高生成质量。我们的模型称为预测视频 VAE (PV-VAE),在视频生成方面实现了卓越的性能,与 UCF101 上的 Wan2.2 VAE 相比,收敛速度提高了 52%,FVD 提高了 34.42。此外,综合分析表明,PV-VAE 不仅表现出良好的可扩展性,生成性能随着 VAE 训练而提高,而且在下游视频理解方面也产生了一致的收益,强调了有效捕获时间相干性和运动先验的潜在空间。