论文
缩小低资源文本转语音的质量差距:VoxCPM2 的高棉语和韩语 LoRA 微调
Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean
摘要
对于资源丰富的语言来说,大型预训练文本转语音 (TTS) 模型听起来几乎是人类的,但对于训练数据中很少见的语言来说,情况就糟糕得多。我们使用 VoxCPM2 研究高棉语和韩语的质量差距,VoxCPM2 是一个 2.4B 参数、无标记器的 TTS 模型,将 MiniCPM-4 语言模型主干与流匹配扩散解码器结合在一起。我们在清理后 25.5 小时内构建了一个共享的语言标记语料库,并使用单个低秩适应 (LoRA) 适配器来适应 VoxCPM2,同时对两种语言进行训练,并将其添加到语言模型和解码器中。适配器是零初始化的,因此训练完全从原始的零样本模型开始。在母语人士听力测试中,最佳适配器的高棉语平均意见得分 (MOS) 从 3.85 上升到 4.23,排名为 64。在 p < 0.001 的配对 Wilcoxon 测试中,这一增益非常显着,并且在仅训练 0.19% 到 3.03% 的参数时即可实现。有两个发现很引人注目。首先,训练损失和人类评分在最佳排名上不一致。损失在排名 128 时最低,但 MOS 在秩 64 时达到峰值。其次,相同的适配器对于韩语没有显着的增益,而基本模型已经很好地涵盖了韩语,而高排名甚至会损害质量。这表明适应主要在基础模型真正薄弱的地方有所帮助。