论文

通过代码混合引导合成语音改进代码转换 ASR

Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech

模型训练合成数据

摘要

由于用于训练的高质量 CS 文本-语音对的可用性有限,码转换 (CS) 自动语音识别 (ASR) 仍然具有挑战性。尽管已经探索了通过文本转语音 (TTS) 的合成数据增强,但现有的 CS TTS 方法主要优化重建保真度,并且没有明确强制语言边界一致性,从而限制了它们对 CS ASR 增强的有效性。本文提出了一种代码混合引导的偏好学习框架,该框架使用代码混合索引(CMI)引导合成语音生成以提高代码转换保真度。在 SEAME 普通话-英语会话语料库上的实验表明,所提出的方法增强了 ASR 微调 合成数据的实用性。具体来说,当 微调 Whisper Large 时,所提出的方法在 DevMAN 和 DevSGE 集上分别将混合错误率 (MER) 从 12.1%/17.8% 降低到 8.9%/14.2%。