论文

通过 Target-KL 正则化驯服音频 VAE

Taming Audio VAEs via Target-KL Regularization

模型训练预训练

摘要

潜在扩散模型已成为许多生成任务的主导范例,包括文本到音频、文本到音乐和文本到语音等音频生成。潜在扩散的一个关键组件是自动编码器(VAE),它将高维信号压缩为有利于下游预测的低帧率连续表示。正则化这些 VAE 具有挑战性,因为在过度正则化(输出质量差)和欠正则化(难以预测)潜在表示之间存在权衡。我们提出了一个框架,用于通过压缩来研究这种权衡,并通过目标 KL 正则化以特定比特率训练音频 VAE。这样可以直接与经过充分研究的离散神经音频编解码器模型进行比较,并构建音频 VAE 的率失真曲线。我们评估了 target-KL 正则化对文本到声音生成的影响,发现全面的压缩率有助于确定最佳生成设置。