论文

重新利用语音分类器来生成基于引导扩散的语音

Repurposing a Speech Classifier for Guided Diffusion-Based Speech Generation

应用与实践内容创作

摘要

分类器引导是一种通过使用噪声调节分类器将采样过程引导至目标类别来控制扩散生成的方法。分类器指导的一个缺点是它需要两个单独训练的模型:分类器和扩散模型。因此,我们研究了一种更紧凑的替代方案,其中传统训练的语音分类器被重新用作扩散生成的骨干。从 log-Mel 空间中的冻结噪声条件分类器开始,我们附加一个轻量级子网络,该子网络重用中间分类器表示,并在去噪分数匹配目标下仅训练该子网络。我们的工作表明,预训练的分类器可以重新用于条件生成,在判别建模和条件语音合成之间提供一个有吸引力的桥梁,从而在单骨干模型中实现高语音质量,同时减少内存占用和计算成本。