论文
通过发音特征分解进行非规范音素识别的多任务学习
Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition
摘要
由于与规范发音的系统偏差以及标记的临床语音数据的可用性有限,病态语音和更广泛的非规范语音对自动音素识别提出了重大挑战。现有的音素识别系统通常根据规范语音进行训练,并将音素视为原子分类标签,这限制了它们检测言语障碍和口音中常见的结构化发音错误的能力。在这项工作中,我们引入了一种用于非规范音素识别的语言结构化方法,该方法将音素预测分解为发音特征维度,例如方式、位置和发声。我们使用分层多任务学习架构来实现这个公式,其中特定于任务的发音特征头学习特征级表示,这些表示随后通过基于交叉注意的融合模块进行集成以产生音素预测。为了解决病态语音标签的稀缺性和噪声问题,我们将该框架与通过动量伪标签(MPL)的半监督学习相结合,并提出了一种级联训练策略,该策略逐步引入发音特征任务,同时采用预训练语音编码器的分阶段解冻。用作病理性语音变化代理的 L2-ARCTIC 实验表明,与强基线架构相比,所提出的方法在音素识别性能方面实现了实质性改进,同时产生与语音特征结构一致的可解释错误模式。这些结果表明,发音特征监督是非规范语音中稳健且可解释的音素识别的一种有前途的策略,并激发了对临床诊断的病理语音数据集的未来验证。