论文
通过自动语音识别的在线细化提高 BEST-RQ 伪标签质量
Enhancing BEST-RQ Pseudo-Label Quality through Online Refinement for Automatic Speech Recognition
摘要
BEST-RQ 是一种简单有效的语音表示学习自监督训练方法,在自动语音识别(ASR)任务上表现良好。它使用固定的在线量化方案生成伪标签,这简化了训练,但提供的监督比迭代细化伪标签的 HuBERT 式模型更弱。在这项工作中,我们改进了在线伪标签生成,同时保持简单性。我们提出了三项修改:用主成分分析(PCA)替换量化器的线性投影,通过迭代码本细化更新码本,以及引入通过码本 蒸馏 更新的附加码本。我们对 LibriSpeech 960 小时的数据集进行预训练,并使用 100 小时的监督 LibriSpeech 数据进行微调。启用所有三项修改后,我们在 LibriSpeech 测试其他集上实现了字错误率 (WER) 相对降低 12%,从 10.1% 提高到 8.8%。