论文

用于多说话者语音识别的软后说话人注入

Soft Posterior Speaker Injection for Multi-Talker Speech Recognition

模型架构Transformer

摘要

在存在重叠语音的情况下,多说话者自动语音识别 (MT-ASR) 仍然具有挑战性。硬分割会引入不可逆的错误,而序列化输出训练 (SOT) 避免显式分割,但不会根据说话者活动来调节预训练编码器。我们提出软后说话人注入(SPSI)。 Soft Posterior Head 预测每帧说话人后验 $\hat{\mathbf{P}}$ 并通过多层特征线性调制 (MFLM) 和说话人记忆提示 (SMP) 将它们注入 Whisper。 SPSI 的优势在重叠最严重和域转移时最大。在受控的两个说话者 LibriSpeech 重叠上,相对于 SOT,SPSI 将高重叠箱中的串联最小排列单词错误率 (cpWER) 从 $61.5\%$ 降低到 $60.0\%$,将整个集合上的串联最小排列单词错误率 (cpWER) 从 $51.9\%$ 降低到 $51.0\%$。相比之下,Speaker CE、SD-CTC、SA-DiCoW 和 Pipeline (oracle/est.\ VAD) 的性能并不优于 SOT。冻结后重叠重度适应将在会话 $8$--$9$ 上保留的 LibriCSS cpWER 从 $42.3\%$ 减少到 $36.8\%$,比 SOT 增加了 $5.5$ 点。源代码可在 https://github.com/HackerHyper/SPSI 获取。