论文

PoDAR:用于生成建模的功率解耦音频表示

PoDAR: Power-Decoupled Audio Representation for Generative Modeling

模型训练预训练

摘要

音频潜在扩散模型的性能主要由生成器表现力和底层潜在空间的可建模性决定。虽然最近的研究主要集中在前者以及提高音频编解码器的重建保真度,但我们证明可以通过显式因子解耦来显着提高潜在的可建模性。我们提出了 PoDAR(功率解耦音频表示),这是一个利用随机功率增强和潜在一致性目标将信号功率与不变语义内容解耦的框架。这种分解使得潜在空间更容易建模,这既加速了下游生成模型的收敛,又提高了最终的整体性能。当应用于带有 F5-TTS 生成器的稳定音频 1.0 VAE 时,PoDAR 实现了约 2 倍的收敛加速,以匹配基线性能,同时在 LibriSpeech-PC 数据集上将最终说话者相似度提高了 0.055,UTMOS 提高了 0.22。此外,将功率隔离到专用通道使得 CFG 能够专门应用于功率不变的内容,从而有效地将稳定的引导机制扩展到更高的规模。