论文

用于空中交通管制语音识别的合成音频生成框架

Synthetic Audio Generation Framework for Air Traffic Control Speech Recognition

模型训练合成数据

摘要

自动语音识别 (ASR) 系统尽管在使用母语语音 (L1) 的通用领域中取得了显着的准确性,但由于强大的信道噪声、非母语 (L2) 英语口音的存在以及数据稀缺,在空中交通管制 (ATC) 等领域却举步维艰。我们提出了一种具有声学特性模拟的合成数据生成管道,专门用于解决缺乏真实数据的问题,以提高 ATC 领域的识别准确性。我们的方法结合了神经生成技术,包括文本到语音、语音转换、L2 到 L1 口音转换,以及为模拟口音语音而构建的新型可控 L1 到 L2 口音转换框架。我们在 ATCO2 语料库上使用 Whisper 模型进行的实验表明,与单独的合成数据或真实数据和合成数据的混合相比,微调 分别比开箱即用的基线和仅真实数据的基线显着提高了单词错误率。