论文
GRACE:保持生成兼容性的高压缩视频潜在表征
GRACE: Generation-aware latent compression for efficient video generation
摘要
高度压缩的视频自动编码器提供了一种加速视频扩散模型的有效方法,因为扩散Transformer (DiT) 在更少的Token上运行。然而,这种自动编码器的训练具有挑战性,因为较高的压缩比会降低重建质量,并且恢复重建质量需要更多的通道,而这会减慢 DiT 的收敛速度。压缩的潜在变量也不同于 DiT 训练的潜在变量,因此预训练的 DiT 必须从头开始重新训练或以相当大的成本进行调整。压缩 DiT 训练的自动编码器似乎可以保持兼容性,但单独优化它以进行重建仍然会使潜在的数据偏离 DiT 所学到的分布。为了解决这个问题,我们提出了用于高效视频生成的世代感知潜在压缩(GRACE),这是一个两阶段框架,可压缩预训练的视频自动编码器,同时保持其与预训练的 DiT 兼容。具体来说,我们从预训练编码器中保留一个隐藏的冻结基数,并学习在以下情况下丢失的信息的剩余潜在数: 更强的压缩,同时将压缩的潜在变量与冻结 DiT 的特征空间中的预训练潜在变量对齐,以便自动编码器针对生成进行优化。然后,我们通过轻量级微调和非对称去噪来调整 DiT,其中基值在残差之前被去噪。 GRACE 将 Wan2.1-I2V-14B 的Token数量减少了 8 倍,在 480x832x81 下的延迟减少了 11.1 倍,同时与 VBench 上压缩前预训练管道的生成质量相匹配。
