论文
自监督语音模型中语调上下文的感知补偿
Perceptual compensation for tonal context in self-supervised speech models
摘要
本研究检验了 wav2vec2.0 架构在多大程度上表现出对语音环境的补偿证据。我们对普通话声调进行了感知补偿实验的伪复制,并比较了纯自我监督的预训练模型和针对普通话 ASR 进行微调的模型之间的嵌入相似性和探测分类器输出。在纯预训练模型的嵌入相似性中没有发现补偿的证据。除了预期的分类改进之外,探测分类器还显示了一些补偿的证据,但未能复制人类在孤立的测试音节上的表现。我们的研究结果与之前仅通过 预训练 出现的对音系结构敏感性的报告形成对比,并表明监督目标可能对于鼓励至少某些类型的音系规律的抽象是必要的。