论文

转录儿童语音:ASR 性能并获得可靠的正字法转录

Transcribing Children's Speech: ASR Performance and Obtaining Reliable Orthographic Transcriptions

应用与实践语音识别与转写

摘要

自动语音识别 (ASR) 通过生成自动转录,有可能大大减少儿童语音研究中的手动注释工作。然而,由于儿童特定的预训练模型有限和高度多样化的噪声条件,在资源匮乏的语言中获得可靠的高质量儿童语音 ASR 转录仍然具有挑战性。本研究通过两个研究问题,在两个荷兰儿童语音数据集 JASMIN 和 DART 上评估来自三个模型系列(Whisper、Parakeet 和 Wav2Vec2)的 9 个 ASR 模型,调查了最先进的 ASR 模型对儿童语音的有效性。研究问题 1 检查应用于儿童语音的 ASR 模型的性能。经过微调的 Whisper-medium 模型取得了最佳的整体性能,在 JASMIN 上的 WER 为 5.54%,在 DART 上为 70.37%,这表明噪声较大的 DART 数据显然更具挑战性。研究问题 2 检查在多大程度上可以选择一个可以自动获得可靠的正字法转录的子集,而无需手动验证。我们使用言语级别选择方法,将 ASR 输出与原始阅读提示进行比较,以识别正确发音的录音。使用所提出的选择方法,42.0% [对于 JASMIN] 和 18.1% [对于 DART] 的话语可以被自动识别为高置信度的正确发音,从而导致话语级别的错误率非常低(精度为 98.3% 或更高),并减少了手动验证的需要。