论文
Saar-Voice:多说话者萨尔布吕肯方言语音语料库
Saar-Voice: A Multi-Speaker Saarbrücken Dialect Speech Corpus
摘要
自然语言处理(NLP)和语音技术近年来取得了重大进展;然而,他们仍然主要关注标准化的语言品种。尽管方言具有文化意义和广泛使用,但在语言资源和计算模型中代表性不足,导致性能差异。为了解决这一差距,我们引入了 Saar-Voice,这是一个针对德语萨尔布吕肯方言的 6 小时语音语料库。该数据集是通过首先通过数字化书籍和本地来源的材料收集文本来创建的。该文本的一个子集由九位发言者录制,我们对文本和语音成分进行了分析,以评估数据集的特征和质量。我们讨论与拼写和说话人变化相关的方法挑战,并探索字素到音素(G2P)的转换。生成的语料库提供对齐的文本和音频表示。这为未来方言感知文本转语音(TTS)的研究奠定了基础,特别是在资源匮乏的场景中,包括零样本和少样本模型适应。