论文

COALA:通过对比正则化器和偏差分数估计进行 ASR 的鲁棒上下文化语音增强语言建模

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

应用与实践语音识别与转写

摘要

上下文偏差旨在将外部知识集成到自动语音识别(ASR)系统中,以准确识别特定领域的实体。在本文中,我们提出了 COALA(上下文化 ASR 利用偏差评分),这是一个强大的框架,旨在增强复杂多实体场景中的语音增强语言模型(SLM)。考虑到 SLM 固有的上下文窗口限制,从大规模偏差列表中识别相关目标实体对于有效识别至关重要。为此,COALA 将 SLM 潜在表示映射到专门的判别空间中,以量化音频片段和候选实体之间的匹配强度。此外,我们还解决了先前研究中处理多目标话语(多个罕见单词同时出现)时的训练崩溃问题。 LibriSpeech 基准测试的实验结果表明,COALA 在各种偏差列表规模上始终如一地实现了卓越的上下文偏差性能。