论文
以伪方言合成数据提升语音语言模型的方言鲁棒性
Dialect-Robust Speech Language Models with Synthetic Pseudo-Dialect Augmentation
摘要
由于数据稀缺,语音语言模型 (SLM) 的性能通常会在方言上下降。传统的文本转语音 (TTS) 增强很难覆盖不同的方言,因为它需要一定量的真实方言语音。我们建议通过标准语言 TTS 模型转换 LLM 生成的方言文本来合成伪方言语音,需要零真实方言语音。此外,我们在训练期间引入中间标准文本预测,充当下游任务的语义规范化。我们通过日语、德语和汉语方言的方言到英语语音翻译来评估方言理解。与合成标准语音基线相比,伪方言增强提高了日语(从 25.38 到 26.24)和德语(从 31.57 到 32.47)的分数。此外,中间标准文本预测有效地弥合了语义差距,将日语的性能提高到 28.26,将中文的性能从 11.67 提高到 16.37。这些结果表明,我们的方法可以扩展到各种语言,而不需要特定的语音资源 每种方言。
