论文

自监督语音识别模型中的说话人组编码

Speaker Group Encoding in Self-supervised Speech Recognition Models

模型评测模型行为与机制分析

摘要

我们研究了自监督语音识别模型 (S3M) 对说话者群体 (SG) 的了解。我们检查了 S3M 的几种状态:预训练、说话人识别 (SID) 微调、自动语音识别 (ASR) 微调以及使用公平性增强算法进行 ASR 微调。我们发现 S3M 编码有关多个说话者群体类别 (SGC) 的信息,包括他们的性别、年龄、方言、种族以及他们是否是母语人士。我们发现,SID 的微调放大了某些 SGC,即那些方差本质上更具语音性的 SGC,尽管它不会放大其他 SGC,即那些方差本质上更具语义性的 SGC。另一方面,ASR 的微调会丢弃语音上不同的说话者组信息 (SGI),但保留语义上不同的 SGI。我们发现,为提高公平性而设计的 ASR 算法改变了 S3M 中 SGI 编码的程度;然而,这对于语音变异的 SGC 来说主要是正确的,而对于语义变异的 SGC 则不太正确。我们讨论每层如何编码 SGI,并确定负责编码不同 SGC 的嵌入的子维度。最后,我们讨论我们的发现如何有助于设计更公平的 ASR 算法。