论文

双模式自监督语音模型的在线预测编码

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

模型训练预训练

摘要

双模式自监督语音模型经过预先训练,可以同时处理流媒体和非流媒体条件。然而,他们的注意力是在不同的上下文范围内计算的,这通常使得优化变得困难。在之前的工作中,我们提出了在线寄存器,额外的词元旨在弥补流模式下丢失的未来上下文,但收益仍然有限。为了解决这些问题,我们对鲁棒双模式 预训练 进行了两项改进:(1) 在线预测编码 (OPC),它通过多步未来预测来规范寄存器;(2) 双模式层归一化,它可以稳定优化。我们对所提出的双模式自监督语音模型进行了微调,用于 LibriSpeech 和 WSJ 上的语音识别。结果表明,OPC 持续缩小了线上线下性能差距;在 LibriSpeech 上,延迟为 160 毫秒时,测试清洁的单词错误率从 3.65% 提高到 3.40%,测试其他的单词错误率从 10.15% 提高到 9.65%。