论文

如何识别新单词:上下文偏置方法与语音的比较 LLM

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

模型评测模型能力评测

摘要

识别新词和稀有词(命名实体、首字母缩略词、特定领域的特殊词以及训练数据中稀缺的其他项目)仍然是自动语音识别 (ASR) 的一个关键挑战。我们为此比较了两种策略:上下文偏置方法,其中扩展了 ASR 模型,以便在推理过程中可以提供单词列表,以及直接用上下文提示语音 大语言模型 (LLM)。我们针对已读和未读语音中的三种语音 LLM 评估了两种基于 Whisper 的上下文偏差方法,报告有偏差、无偏差和总体单词错误率 (WER)。上下文偏差方法将有偏差的 WER 相对减少了 88%,而其他单词基本上不受影响。语音 LLM 在朗读语音方面表现出色,但对非朗读语音的泛化能力较差,并且对干扰项计数和提示语序很敏感。我们描述了由此产生的权衡,以指导方法选择。