论文

MoDiCoL:用于鲁棒语音识别的模块化诊断持续学习数据集

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

模型评测基准与评测资源

摘要

现代自动语音识别 (ASR) 系统在标准基准上取得了显着进步,但由于录音条件、口音、语音障碍和噪音而导致现实世界的分布变化,出现了性能差距。现有的数据集和基准通常会隔离这些因素,从而忽略了它们在现实应用程序中的共现情况。在本文中,我们认为模型的鲁棒性可以被视为一种不断发展的动态能力,并且我们介绍了 MoDiCoL,这是一个模块化诊断持续学习数据集,旨在对语言内容、说话者特征和声学环境进行受控分析。此外,我们提出了一个受现实世界启发的持续学习课程来模拟增量更新并研究鲁棒性是如何获得、转移和遗忘的。我们评估了三种持续学习策略,并提供了有关不断变化的条件下稳健性的详细见解。