论文
无分词边界的语音上下文偏置:深度门控与读音空间匹配
Boundary-Free Contextual Biasing: Depth-Adaptive Gating and Reading-Space Matching for Unsegmented Languages
摘要
上下文偏差为 ASR 系统提供了推理时的预期单词列表,但现有方法依赖于日语和中文不提供的单词边界。我们提出了一种用于冻结公共 CTC 模型的无边界偏置解码器,该解码器基于字符级 Aho-Corasick 自动机构建,无需训练,也无需第二遍。两种基于证据的机制取代了边界:一个深度自适应门,用于设置从匹配深度推动的难度,以及当音频正确但字符错误时的阅读空间匹配。在 Aishell-1 NE 的硬 R1 子集上,我们达到了 66.5% 的召回率,高于经过训练的 CLAS 基线 (64%),无需重新调整即可转移到 WenetSpeech 和第二个架构。我们发布了第一个开放的日语上下文偏差基准,其中偏差将稀有词召回率提高了 25 个百分点,精确度高于 97%,而对于 1,000 个单词的列表,仍将其提高了 19 和 22 个百分点。