论文
好得令人难以置信:现代自动语音识别用于语音增强评估的研究
Too Good to Be True: A Study on Modern Automatic Speech Recognition for the Evaluation of Speech Enhancement
摘要
语音增强 (SE) 系统通常使用各种仪器指标进行评估。使用自动语音识别 (ASR) 系统来评估 SE 性能在文献中很常见,通常以单词错误率 (WER) 来衡量。然而,WER 分数在很大程度上取决于 ASR 系统和文本规范化管道的选择。在本文中,我们研究了现代 ASR 模型如何与人类对增强语音的识别相关联。听力实验表明,具有大规模噪声训练和嵌入式语言模型的现代 ASR 模型比简单模型与人类 WER 的相关性更高,并且传感器模型提供最可靠的转录。尽管如此,我们还表明,这些模型对噪声的鲁棒性和上下文的使用对于以声学为重点的增强性能评估来说可能无法提供信息。