论文
识别和表征自监督语音识别模型的音素级嵌入中的人口统计不公平性
Identifying and typifying demographic unfairness in phoneme-level embeddings of self-supervised speech recognition models
摘要
据观察,现代自动语音识别 (ASR) 系统对于某些说话者群体 (SG) 来说比其他人表现得更好,尽管最近整体性能有所提高。实现更公平的 ASR 的一个潜在障碍是对语音编码器模型所产生的建模错误类型的更细致的理解,特别是高性能和低性能 SG 的嵌入结构之间的差异。本文提出了一个框架,代表了 ASR 系统中音素建模过程中可能出现的两种错误:音素嵌入中的随机误差/高方差,与系统误差/嵌入偏差。我们发现,仅在单个通常处于不利地位的 SG 上训练音素分类探针,有时会提高该 SG 的性能,这是音素嵌入中存在 SG 级偏差的证据。另一方面,我们发现音素方差水平较高的说话者和 SG 与音素预测精度较差的说话者和 SG 相同。我们的结论是,两种类型的错误都存在于音素嵌入中,并且都是 ASR 中 SG 级不公平的候选原因,尽管随机错误可能比系统错误对公平性的阻碍更大。此外,我们发现使用公平增强算法(域增强和对抗训练)微调编码器模型既不会改变域内音素分类探针训练的好处,也不会改变随机嵌入误差的测量水平。