论文

先连续,后离散:没有维度崩溃的 VQ-VAE

Continuous First, Discrete Later: VQ-VAEs Without Dimensional Collapse

模型训练预训练

摘要

虽然提高 VQ-VAE 性能的许多方法都集中在码本大小和利用率上,但维度崩溃的影响(训练后的 VQ-VAE 表示存在于极低维度的子空间(满秩的 1-2%))仍然没有得到解决。我们从理论上和经验上证明,维度崩溃会导致各种密码本改进技术无法超越的硬损失下限。我们的分析框架扩展了 Saxe 等人的顺序学习效果。 [2014]通过引入率失真理论的思想,解释了VQ抑制低方差方向如何引起潜在崩溃。我们的理论证明了一个简单的解决方案:在引入 VQ 之前将模型训练为(非量化)自动编码器的“预热阶段”。在合成实验以及大规模图像 (VQGAN) 和音频 (WavTokenizer) VQ-VAE 上,我们表明 AE Warm-Up 成功恢复了表示维度,从而在相同的训练预算下降低了重建和感知损失。在码本大小 $K \in$ {$2^{10}, 2^{14}, 2^{16}$} 中,AE 预热将 VQGAN 码本有效维度从 3-5 提高到 17-19,并将 rFID 降低 17-35%;在 $K \in$ {$2^{13}, 2^{14}$} 处的 WavTokenizer 上,它将码本维度从 4 提高到 17-19,并将 PESQ 提高了 11-14%。我们凭经验描述了预热持续时间如何控制可实现的最终损失。与实验一致,我们的理论分析将下游性能预测为预热长度的函数,从而实现从 AE 预热切换到 VQ-VAE 训练的自适应标准。