论文

通过域内数据增强改进构音障碍语音的端到端语音识别

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

模型训练合成数据

摘要

构音障碍语音识别对于促进构音障碍患者之间的有效沟通至关重要。然而,由于不同的严重程度和有限的数据可用性,准确识别构音障碍语音提出了重大挑战。在本文中,我们通过 微调 端到端预训练 Wav2Vec2 模型探索构音障碍自动语音识别 (ASR) 系统的数据增强技术,特别关注严重程度。为了解决构音障碍语音 微调 预训练 ASR 系统中数据稀缺的挑战和对大量数据的需求,我们研究了四种著名的数据增强方法:语速修改(SRM)、音调修改(PM)、共振峰修改(FM)和声道长度扰动(VTLP),针对构音障碍的不同方面进行定制。该研究使用针对每个严重级别单独微调的 Wav2Vec2 模型作为基线系统。此外,我们使用增强数据对 ASR 模型进行了特定严重性的 微调。结果表明,每种增强技术在不同严重程度下都有不同的功效模式。对于 \textit{low} (9.02\%) 和 \textit{medium} (38.11\%) 严重性,使用 SRM ($s$=0.8) 实现了最佳 WER,对于 \textit{high} 严重性 (55.15\%) 使用 PM ($τ$=0.8) 实现了最佳 WER,反映出相对改进为 30.02\%、16.64\% 和分别为 15.47\%。这些结果证实了增强方法在改善构音障碍 ASR 表现方面的有效性。