论文
BlueMagpie-TTS:用于台湾口音语码转换语音的高效标记器、语言模型和 TTS
BlueMagpie-TTS: A Token-Efficient Tokenizer, Language Model, and TTS for Taiwanese-Accent Code-Switching Speech
摘要
现成的 TTS 系统不太适合台湾普通话。他们的口音默认为其他普通话变体,他们的标记器过度分割常见的台湾文本,并且他们的发音在语码转换边界处降级,其中中文和英语在一个话语中交替出现。这些问题都有一个根源:文本方面缺乏对台湾语境的适应。我们从下到上处理文本侧。 PangolinTokenizer 是一种在台湾上下文数据上训练的字节级 BPE 分词器,在九种分词器中达到了最低的分词率(0.485 个分词/字符)和最小的词汇量。 Barbet 是一个在 PangolinTokenizer 上训练的十亿参数繁体中文模型,作为文本语义前端,在 14 项任务评估中在同类公共模型中排名第一。 BlueMagpie-TTS 通过学习桥将 Barbet 连接到 VoxCPM2 的预训练声学堆栈,保持声学堆栈固定。在台湾本土 1000 句测试集上,CER 从 11.45% 降低到 4.81%,WER 从 14.83% 降低到 5.36%,相对降低了 58.0% 和 63.9%。在一项针对 10 名听众的 500 个句子的盲听研究中,65.6% 的多数票更喜欢 BlueMagpie-TTS。