论文

藏语-TTS:具有大模型自适应的低资源藏语语音合成

Tibetan-TTS:Low-Resource Tibetan Speech Synthesis with Large Model Adaptation

模型训练监督微调与指令调优

摘要

藏文文本转语音(TTS)长期以来一直受到语音资源稀缺、方言差异显着以及书面文本和口语发音之间复杂映射的挑战。为了解决这些问题,据我们所知,这项工作提出了业界第一个基于大模型的藏语 TTS 系统,该系统建立在星辰 AGI 实验室开发的大型语音合成模型的基础上。该系统集成了数据质量增强、面向藏文的文本表示和分词器自适应以及低资源藏文语音合成的跨语言自适应训练。实验结果表明,该系统能够在资源匮乏的情况下生成稳定、自然、易懂的藏语语音。在主观评价中,音节级系统和基于BPE的系统的MOS分数分别达到4.28和4.35,发音准确率分别达到97.6%和96.6%,优于外部商用藏语TTS接口。这些结果表明,将大模型主干与面向藏语的文本表示自适应和跨语言自适应训练相结合,可以实现高度可用的低资源藏语语音合成,也为未来统一的多方言藏语语音合成提供了技术基础。