论文

AudioGAR:桥接潜在音频生成模型中的重建和生成

AudioGAR: Bridging Reconstruction and Generation in Latent Audio Generative Models

应用与实践语音交互与综合语音服务

摘要

潜在音频生成模型通常分两个阶段进行训练:首先学习音频编解码器,然后学习潜在生成模型。这种分解会导致解码器训练生成不匹配:编解码器解码器在编码器引发的潜变量上进行训练,但在推理时部署在生成器生成的潜变量上。在不同的数据集和潜在生成模型中,我们在 FD 和 FAD 下观察到明显的重建生成差距,这表明强大的重建质量并不一定会转化为强大的端到端生成质量。自然的补救措施是在生成的潜变量上调整解码器,但生成的潜变量缺乏与源音频的对应关系,因此无法直接提供用于解码器微调的配对监督。我们引入 AudioGAR,它通过扰动编码器潜变量并通过冻结的潜在扩散模型对其进行去噪来构造中间潜变量。这些潜变量形成了从重建到生成的轨迹,低噪声潜变量保留了源对应性并支持配对解码器微调。我们在微调上仅使用这些潜变量上的编解码器解码器,同时保持编解码器编码器和潜在生成模型冻结。当应用于 AudioX 时,AudioGAR 显着提高了生成性能。只需要原训练音频时数的1.5\%,成本是原训练的0.26\%。

AudioGAR:桥接潜在音频生成模型中的重建和生成的原论文方法或结果图
图 3:AudioGAR 流程示意图。