论文

使用音韵级 Wav2Vec2 进行普通话自动误读检测和诊断

Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis

应用与实践语音识别与转写

摘要

自动错误发音检测和诊断(MDD)在二语普通话发音学习中发挥着至关重要的作用。虽然基于端到端 (E2E) 的 MDD 方法大大提高了音素级检测的准确性,但诊断反馈仍然有限,因为分段错误和音调错误没有明确分离。在本文中,我们提出了一种基于语音特征的 MDD 框架,该框架在统一的 Wav2Vec2 CTC 架构中对分段和音调属性进行建模。实验结果表明,与仅音素基线系统相比,该方法将错误接受率(FAR)降低了10.1%,诊断错误率(DER)降低了23.6%。通过将音素分解为底层音系成分,所提出的方法可以为第二语言学习者提供更详细和可解释的诊断反馈。