论文
通过过滤和选择改进大规模弱监督 ASR
Improving Large-Scale Weakly Supervised ASR by Filtering and Selection
摘要
利用大规模弱监督数据集对于训练强大的端到端自动语音识别(ASR)模型至关重要。然而,此类数据集通常包含噪声标签且缺乏领域特异性,限制了其有效性。为了解决这些问题并更好地利用弱监督数据集,我们提出了一种结合数据过滤和选择的新颖训练方法。我们的方法包括三个步骤:对整个数据集进行预训练,对基于字符错误率 (CER) 的过滤子集进行持续预训练,以及对从过滤子集中选择的少量与目标域在声学上相似的样本进行 微调。在使用 90,000 小时弱监督日本数据集的实验中,所提出的过滤和选择方法协同地将 CER 分别降低了 6.4% 和 4.0%,即使这些步骤重复使用了第一个预训练步骤中已使用的训练样本。