论文

时间还是网络层:定位wav2vec 2.0中的构音障碍语音线索

Time vs. Layer: Locating Predictive Cues for Dysarthric Speech Descriptors in wav2vec 2.0

模型评测模型行为与机制分析

摘要

Wav2vec 2.0(W2V2)通过有效捕捉非典型语音的特征,在病理性语音分析中表现出了强大的性能。尽管它取得了成功,但仍不清楚其学习表示的哪些组成部分对于特定的下游任务最具信息性。在本研究中,我们通过使用语音无障碍项目数据集的注释来研究构音障碍语音描述符的回归来解决这个问题。我们关注五​​个描述符,每个描述符针对语音或声音产生的不同方面:可理解性、不精确的辅音、不恰当的停顿、刺耳的声音和响度单一。语音表示源自基于 W2V2 的特征提取器,我们使用注意力统计池化系统地比较分层和时间聚合策略。我们的结果表明,通过逐层表示可以最好地捕获清晰度,而不精确的辅音、刺耳的声音和响度单一则受益于时间建模。对于不适当的停顿,两种方法都没有观察到明显的优势。