论文

BaLEEN:偏向于上下文感知 ASR 的潜在编码实体

BaLEEN: Biasing with Latent Encoded Entities for Context-Aware ASR

模型训练参数高效训练

摘要

转录特定领域的实体和罕见的专有名词仍然是自动语音识别(ASR)中的主要挑战。在本文中,我们提出了 BaLEEN(Biasing with Latent Encoded Entities),这是一种轻量级的、基于超网络的框架,用于动态上下文适应,无需微调底层 ASR 模型。 BaLEEN 使用预训练的语言模型对可变长度的上下文关键字进行编码,通过感知器瓶颈将它们压缩为固定的潜在向量序列,并将上下文相关的偏差向量直接注入到 ASR 模型的中间编码器表示中。由于语言模型和主干 ASR 模型在训练期间都保持完全冻结,因此 BaLEEN 作为即插即用适配器运行,在预先计算上下文偏差时,在推理时产生零计算开销。我们使用源自维基百科的语料库(带有带注释的命名实体和合成语音)在基于 CTC 的 ASR 模型上评估我们的方法。实验结果表明,相对于无偏基线,BaLEEN 在测试集上将关键字漏失率降低了 8.7%,同时将总体单词错误率提高了 21%,字符错误率提高了 28%。