论文

从合成语音构建和评估固定语音泰语 TTS

Building and Evaluating Fixed-Voice Thai TTS from Synthetic Speech

摘要

在资源匮乏的环境中,部署 TTS 通常需要在推理成本高昂的大型语音克隆模型或需要特定说话者语料库的紧凑固定语音系统之间进行选择。我们研究第三条路线:使用大型语音克隆模型作为可编程数据源,将短语音参考(例如 15 秒)转变为完全接受合成语音训练的紧凑固定语音学生。这种设置使得管道设计变得重要:教师错误成为训练目标,而过滤失败的一代可以减少困难文本的覆盖范围。泰语进一步引入了来自模糊词界、词汇语气、名称和外来词、数字语言以及泰语-英语语码转换的挑战。我们研究文本准备、合成生成、质量过滤、拒绝采样和前端选择如何影响最终的学生,以及教师仍然存在哪些局限性。我们评估 CER、挑战设置关键字准确性、韵律停顿准确性、说话者相似度和语速。由此产生的 82M 参数模型 Wayu-Paxa-TTS-Edge 可在设备上实现泰语 TTS,无需参考音频。它实现了 68.2% 的挑战设置关键字准确度(Gemini 3.1 的 85.5%)和 91.4% 的暂停准确度,超过了 OmniVoice 老师(89.9%),达到了 Gemini 3.1 的 94.8%。它还实现了三个系统中最低的停顿放置错误和词内停顿率,泰语和英语的 CER 分别为 3.7% 和 1.1%。我们开源泰语 TTS 开发的模型和评估框架。