论文

Sarashina2.2-TTS:通过数据扩展与定向合成处理日语汉字多音

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

应用与实践内容创作

摘要

虽然基于 大语言模型 (LLM) 的文本转语音 (TTS) 系统已经实现了高质量的语音合成,但大多数现有系统侧重于英语和中文。然而,日语仍未得到充分探索,其独特的语言挑战(例如广泛的依赖于上下文的汉字复音)尚未得到充分解决。在这里,我们介绍 Sarashina2.2-TTS (https://github.com/sbintuitions/sarashina2.2-tts),这是一个以日语为中心的 LLM-TTS 系统,它通过数据策略和评估方法双重方法应对这些挑战。首先,我们将训练规模扩大到大约 361,000 小时的语音,并均衡地混合了日语和英语数据。此外,我们设计了一个有针对性的数据增强管道,涵盖日本文化厅指定的所有 2,136 个常用汉字,以有效解决汉字复音消歧问题。其次,我们介绍了Joyo Kanji Yomi Benchmark(https://github.com/sbintuitions/JoyoKanji-Yomi-Benchmark),涵盖了所有2,136个Joyo汉字及其4,378个读音。除了这个基准之外,我们还提出了假名-CER,这是一种将合成语音与假名空间中的参考读音进行比较的指标,消除了拼写变化以直接测量发音正确性。实验表明,我们有针对性的数据增强显着提高了读音准确率。总体而言,Sarashina2.2-TTS 实现了最先进的汉字级读音准确率,并匹配一般句子级发音的顶级基线,同时在零样本日语语音合成中提供最高的说话者相似度。此外,跨语言评估表明,Sarashina2.2-TTS 是唯一一个无论提示语言如何都能保持稳定日语发音的系统,证实了我们的平衡训练方法提高了跨语言鲁棒性。