论文
预训练的自监督语音模型可以识别看不见的辅音
Pretrained self-supervised speech models can recognize unseen consonants
摘要
现代预训练的自监督自动语音识别模型在大规模音频数据上进行训练,将语音编码为上下文表示。然而,他们的训练数据严重偏向于高资源语言,而来自低资源语言的数据很少,这引发了人们对类型上不常见语音(例如主要在科伊桑语言中发现的点击辅音)的潜在代表性不足的担忧。这引出了我们的中心研究问题:这些模型能否像其他语音一样准确地识别点击辅音?为了解决这个问题,我们根据两种点击量丰富的科伊桑语言(G|ui 和 West !Xoon)的数据对预训练的自监督语音模型(Wav2Vec2 和 HuBERT)进行微调和比较。我们的结果表明,经过微调的模型始终比非点击更准确地识别点击,这表明自我监督能够对包括罕见音素在内的人类语音进行泛化。