论文

SpeechLLM 先定位错误再检索术语的免训练 ASR

Training-Free Contextual ASR via SpeechLLM-Based Error-Aware Selective Retrieval

应用与实践上下文与知识检索增强语音识别与转写

摘要

对于自动语音识别 (ASR) 来说,特定领域和低频术语的识别仍然具有挑战性。尽管上下文偏置可以提高他们的识别能力,但直接提供大型术语词典会引入许多不相关的偏差术语。基于检索的上下文偏置通过从外部词典中选择候选术语来解决这个问题,但是查询许多识别的单词需要大量的字典查找,并且可能会产生针对性较差的候选词。我们提出了一种免训练的上下文 ASR 框架,其中预训练的语音大语言模型 (SpeechLLM) 联合生成 ASR 假设并定位可能涉及特定领域术语的错误跨度。仅使用已定位的文本片段从外部术语词典中检索语音相似的术语。然后,相同的 SpeechLLM 会根据首轮识别假设和检索到的术语重新识别音频,而无需进行特定于任务的模型训练。为了评估跨领域的适用性,我们评估了医疗、空中交通管制和金融演讲的框架。所提出的方法大大减少了字典查询,同时提高了相关候选术语的召回和排名以及所有三个领域的第二遍 ASR 性能。

先识别并定位领域术语错误,再检索发音相似词并进行二次语音识别。
图1(图注摘要):先识别并定位领域术语错误,再检索发音相似词并进行二次语音识别。