论文

学会倾听犹豫:持续学习不流利感知 ASR

Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

模型训练持续学习

摘要

尽管大规模自动语音识别 (ASR) 取得了进步,但不流畅的语音仍然具有挑战性,因为最先进的系统通常经过优化以忽略不流畅的内容,从而导致信息丢失和幻觉。之前的工作主要集中在逐字转录和不流畅标记的整合上,但是在有限的数据集上调整模型可能会导致一般领域知识的灾难性遗忘。我们通过利用带有显式不流畅标记的持续学习(CL)来解决这一差距。我们首先将这些词元引入预训练的 ASR 模型中以建立稳定的词元机制,然后继续对具有不同不流畅分布的其他数据集进行训练。通过对训练期间模型动态的详细分析,我们确定了标记学习和 ASR 性能之间的权衡,以及跨 CL 方法共享的一致的交叉注意力头机制。