论文

对不同语音的人类和自动语音识别进行基准测试:初步结果

Benchmarking Human and Automatic Speech Recognition of Diverse Speech: Initial Results

模型评测模型能力评测

摘要

人类通常被认为是最好的听众,并被视为自动语音识别 (ASR) 系统的上限性能。我们对最先进的 ASR 系统和荷兰本土听众在识别“多样化”语音(特别是荷兰儿童和老年人的语音以及佛兰芒语)方面的表现进行了初步比较。 Google Telephony 的性能优于其他 ASR 系统。重要的是,ASR 系统向听众展示了相似的性能,在特定情况下甚至超过了听众。我们发现听众和 ASR 系统之间的轻微性能差异与说话者的年龄、地区口音和话语长度有关。未来的研究应该集中于使 ASR 系统对与年龄和地区口音相关的声学变化更加鲁棒。对测试刺激和完整 Jasmin-CGN 测试集的 ASR 识别性能进行比较,显示了特定测试集对人类和 ASR 性能基准测试结论的影响。