论文

GRACE:保持生成兼容性的高压缩视频潜在表征

GRACE: Generation-aware latent compression for efficient video generation

模型优化模型训练应用与实践参数高效训练模型压缩内容创作

摘要

高度压缩的视频自动编码器提供了一种加速视频扩散模型的有效方法,因为扩散Transformer (DiT) 在更少的Token上运行。然而,这种自动编码器的训练具有挑战性,因为较高的压缩比会降低重建质量,并且恢复重建质量需要更多的通道,而这会减慢 DiT 的收敛速度。压缩的潜在变量也不同于 DiT 训练的潜在变量,因此预训练的 DiT 必须从头开始重新训练或以相当大的成本进行调整。压缩 DiT 训练的自动编码器似乎可以保持兼容性,但单独优化它以进行重建仍然会使潜在的数据偏离 DiT 所学到的分布。为了解决这个问题,我们提出了用于高效视频生成的世代感知潜在压缩(GRACE),这是一个两阶段框架,可压缩预训练的视频自动编码器,同时保持其与预训练的 DiT 兼容。具体来说,我们从预训练编码器中保留一个隐藏的冻结基数,并学习在以下情况下丢失的信息的剩余潜在数: 更强的压缩,同时将压缩的潜在变量与冻结 DiT 的特征空间中的预训练潜在变量对齐,以便自动编码器针对生成进行优化。然后,我们通过轻量级微调和非对称去噪来调整 DiT,其中基值在残差之前被去噪。 GRACE 将 Wan2.1-I2V-14B 的Token数量减少了 8 倍,在 480x832x81 下的延迟减少了 11.1 倍,同时与 VBench 上压缩前预训练管道的生成质量相匹配。

GRACE:保持生成兼容性的高压缩视频潜在表征:论文原图
图 2:总体架构。第 1 阶段训练自动编码器。冻结编码器 ℰ\mathcal{E} 将下采样输入映射到 𝐳base\mathbf{z}_{\text{base}},残差编码器 ℰres\mathcal{E}_{\text{res}} 将全分辨率输入映射到 𝐳res\mathbf{z}_{\text{res}},𝒟^\hat{\mathcal{D}}解码两者,而 ℒalign\mathcal{L}_{\text{align}} 将压缩潜在变量与冻结 DiT 内的预训练潜在变量相匹配。第 1 阶段右侧的虚线框显示了添加到 ℰres\mathcal{E}_{\text{res}} 和 𝒟^\hat{\mathcal{D}} 的块的简化视图。第 2 阶段使用 LoRA 使 DiT 适应压缩潜伏,在每一步以比 𝐳res\mathbf{z}_{\text{res}} 更低的噪声水平对 𝐳base\mathbf{z}_{\text{base}} 进行去噪,因此首先对基进行去噪。