论文
重新审视现代端到端语音识别的语言模型困惑度与 ASR 单词错误率之间的关系
Revisiting the Relation Between Language Model Perplexity and ASR Word Error Rate for Modern End-to-End Speech Recognition
摘要
语言模型 (LM) 困惑度 (PPL) 历来被用作自动语音识别 (ASR) 单词错误率 (WER) 的代理,先前的工作报告了对数空间中的近似线性关系。现代端到端 ASR 系统挑战了这一假设,因为它们已经包含内部语言建模能力,通常无需外部语言模型即可进行评估,并且现在可以通过不同的识别策略与神经 LM 和 大语言模型 (LLM) 相结合。本文重新探讨了现代 ASR 系统的 PPL 和 WER 之间的关系。我们研究外部 LM 是否仍能改进当前的端到端 ASR 系统、PPL-WER 关系在对数空间中是否保持线性、编码器上下文长度如何影响这种关系,以及 LLM 困惑如何适应标准神经 LM 观察到的趋势。我们进一步研究了基于注意力的编码器-解码器系统中的内部语言模型(ILM),并表明 ILM 减法改变了观察到的 PPL-WER 关系,这表明在解释外部 LM 质量的影响时必须考虑解码器的内部 LM。