论文

以伪方言合成数据提升语音语言模型的方言鲁棒性

Dialect-Robust Speech Language Models with Synthetic Pseudo-Dialect Augmentation

模型训练应用与实践监督微调与指令调优合成数据机器翻译

摘要

由于数据稀缺,语音语言模型 (SLM) 的性能通常会在方言上下降。传统的文本转语音 (TTS) 增强很难覆盖不同的方言,因为它需要一定量的真实方言语音。我们建议通过标准语言 TTS 模型转换 LLM 生成的方言文本来合成伪方言语音,需要零真实方言语音。此外,我们在训练期间引入中间标准文本预测,充当下游任务的语义规范化。我们通过日语、德语和汉语方言的方言到英语语音翻译来评估方言理解。与合成标准语音基线相比,伪方言增强提高了日语(从 25.38 到 26.24)和德语(从 31.57 到 32.47)的分数。此外,中间标准文本预测有效地弥合了语义差距,将日语的性能提高到 28.26,将中文的性能从 11.67 提高到 16.37。这些结果表明,我们的方法可以扩展到各种语言,而不需要特定的语音资源 每种方言。

以伪方言合成数据提升语音语言模型的方言鲁棒性:论文原图
图 1:提出的伪方言语音增强。 LLM 和标准 TTS 模型根据标准对 {xs,ts}\{x_{s},t_{s}\} 和翻译 ysy_{s} 生成伪方言文本 t~d\tilde{t}_{d} 和语音 x~d\tilde{x}_{d}。这分别产生用于单任务和多任务 SLM 训练的 {x~d,ys}\{\tilde{x}_{d},y_{s}\} 和 {x~d,ts,ys}\{\tilde{x}_{d},t_{s},y_{s}\}。