论文
BanglaBox:孟加拉语TTS基础模型适配与零样本声音克隆
BanglaBox: A Phonetically-Balanced Corpus and Data-Efficient Foundation-Model Adaptation for Bangla Text-to-Speech with Zero-Shot Voice Cloning
摘要
我们提出了一种将英语预训练的自回归 TTS 基础模型调整为代表性不足的语言的方法,并在孟加拉语孟加拉语上进行了演示。现有的孟加拉语 TTS 语料库很小,而且是单说话者,而且据我们所知,没有可用于孟加拉语语域的开放式零样本语音克隆系统。我们贡献了一个语音和性别平衡的两层孟加拉孟加拉语语料库,通过联合集群(juktakkhor)上的分层 Jensen-Shannon 发散目标实现平衡,以及三个微调更改:合并一致的分词器扩展、孟加拉语文本规范化和提示屏蔽的双损失目标。这些更改保留了跨语言切换的零样本克隆。我们的 BanglaEval 协议应用 Wilcoxon 符号等级测试,并针对母语人士评级进行 Bonferroni 校正。 BanglaBox 实现了近乎自然的自然度,在自然度、说话人相似度和清晰度方面优于商业和开源基线,并且在使用大约 7 倍的 Bangla 微调音频的情况下,达到了与之前几次拍摄结果相当的说话人相似度。我们使用困难的现实世界文本的七类压力集、公共 BnTTS 评估基准以及没有语言模型编写的自然出现的孟加拉语,进一步验证了我们自己的测试分割之外的配方。所有产物,包括语料库、权重、代码和完整的评估材料,都是无条件公开发布的。
