论文

具有常见单词提示和偏差单词位置预测的语音中 ASR 的上下文偏差 LLM

Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction

应用与实践语音识别与转写

摘要

语音感知 LLM (SLLM) 最近实​​现了最先进的 ASR 性能;然而,他们仍然无法准确转录训练数据中很少或从未出现的偏见词。上下文偏差机制通常是通过文本提示或附加模块将预定义的偏差单词列表引入模型来实现的。为了进一步改进,预定义的偏见词可以与其音素表示配对作为发音提示。通常,音素序列是通过 G2P 系统生成的,该系统涵盖目标语言和偏向词的领域。因此,当兼容的G2P系统不可用时,音素辅助的上下文偏置变得难以执行。此外,手动添加准确的音素序列需要先进的语音知识。在本文中,我们基于与一组常见单词相关的声学线索来探索 SLLM 中的上下文偏差,这些单词的发音与目标偏差单词的发音部分相似。我们假设 ASR 应用程序中最终用户不需要特殊的语音知识或利用 G2P 工具进行推理。为了增强鲁棒性,我们还引入了以多输出学习方式实现的偏差词位置预测。与基线系统相比,我们的方法将偏见词识别错误减少了 16.3%,包括域外数据。