论文

ASR 微调 的少量合成重音语音:什么有帮助以及何时有帮助?

Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?

模型训练合成数据

摘要

当真实的重音录音稀缺时,合成重音语音是改进自动语音识别 (ASR) 的一种很有前途的方法。我们询问是什么让这些数据对 ASR 微调 有用:目标口音音素编辑使识别器暴露于特定口音的发音,或充当音素空间增强的随机音素扰动。在少数镜头 TTS 管道中,我们将 LLM 生成的重音编辑与匹配率随机替换以及使用 真值 重音音素和韵律的预言机控制进行比较。随机替换恢复了大部分 ASR 增益:LLM 目标重音编辑仅比随机改进了很小的幅度,真值 音素保持接近随机基线,并且随着合成 ASR 微调 集变大而几乎与其收敛,并且添加 真值 韵律仅产生适度的进一步增益。将合成语音与真实口音语音混合也可以稳定低资源 微调,但固定的合成预算稍后会稀释真实数据中的信息,这表明真实合成比率很重要。