论文

Paradee:将 Kokoro-82M 提炼为 8M-参数单语音文本转语音模型

Paradee: Distilling Kokoro-82M into an 8M-Parameter Single-Voice Text-to-Speech Model

摘要

我们将 Kokoro-82M(一种广泛使用的开放式文本转语音模型,具有 54 种声音)提炼为 Paradee(一种可以使用其中一种声音的 8.07M-参数模型)。 Paradee 保留了 Kokoro 的架构,其层数要窄得多,并且它的两半分别针对冻结的教师模型进行训练。它的参数数量减少了 10 倍,所需的计算量也减少了 15 倍。我们首先将语料库与教师模型进行合成,并保留其时长、音高、能量和音素特征。然后,我们训练一个小型文本端来预测这些值,并训练一个小型解码器将教师模型保存的值转换为教师模型的音频,首先进行频谱损失,然后进行对抗。最后,我们连接两半并将权重量化为 int8。它不需要对齐学习,也不需要联合训练,并且可以在一台笔记本电脑上运行。 Paradee 存储在 int8 中,大小为 8.5 MB,在一个 CPU 线程上的运行速度比实时速度快 25 倍,在 UTMOS 上得分为 4.41,而教师模型的得分为 4.52。 学生模型最初保持轻微的嗡嗡声,我们将其追溯到 2 至 8 kHz 之间的有声语音相位。合成后应用的锁相滤波器去除了大部分,没有训练也没有额外的参数。代码、模型文件和音频样本位于 https://github.com/sahilmahendrakar/paradee