论文

扩大人力和 G2P 监督以实现稳健的语音转录

Scaling Human and G2P Supervision for Robust Phonetic Transcription

模型训练合成数据

摘要

专家语音标注的成本很高,尤其是对于非标准方言和非典型语音。一种常见的替代方案是使用字素到音素 (G2P) 模型从文本转录本中大规模自动生成语音标签。我们研究英语中自动语音转录性能如何与人类和 G2P 监督相适应。使用涵盖母语、非母语和中风后语音的精心策划的 80 小时基准,我们确定了监督质量阈值:G2P 监督仅在可用的人工注释时间少于 20-30 小时时才有帮助。超过这个阈值,它不会提供任何显着的好处,并且会降低跨方言的稳健性。在此阈值之后有效的是 ASR 预训练,与之前的系统相比,我们使用它实现了加权电话特征错误率降低 2.3 倍,并且在非母语和失语语音方面取得了巨大的进步。这些结果表明,数量驱动的 G2P 扩展可能会导致鲁棒泛化的收益递减。