论文

自监督语音模型在哪里变得不公平?

Where Do Self-Supervised Speech Models Become Unfair?

模型评测鲁棒性、公平性与可信度评测

摘要

众所周知,语音编码器模型可以比其他人更好地模拟某些说话者群体 (SG) 的成员。然而,在技术层面上几乎没有研究确定为什么会发生这种情况。据我们所知,我们提出了预训练自监督语音编码器模型(S3M)的第一个分层公平性分析,探测每个嵌入层以进行说话人识别(SID)自动语音识别(ASR)。我们发现,从第一个潜在层开始,S3M 为这两项任务生成的嵌入对某些 SG 存在偏差。此外,我们发现在我们研究中的所有模型中,SID 与 ASR 的分层偏差模式相反:SID 偏差在能够最小化整体 SID 误差的层中最小化;另一方面,ASR 偏差在层中最大化,从而最小化总体 ASR 误差。当探测针对 ASR 进行微调的 S3M 时,ASR 的逆偏差/误差关系不受影响,这表明 SG 水平偏差是在预训练期间建立的,并且难以消除。