论文

减少自监督语音表示中的口音与语言混淆

Mitigating Accent-Language Confusion in Self-Supervised Speech Representations for Language Identification

模型评测模型推理应用与实践推理验证与自校正鲁棒性、公平性与可信度评测语音识别与转写

摘要

口语识别(LID)旨在识别目标语言,无论口音如何。然而,在实践中,根据自监督语音表示进行微调的 LID 模型经常将口音与语言混淆,将非母语 (L2) 语音错误地分类为说话者的第一语言 (L1)。我们发现非母语语音表示位于母语目标语言和母语 L1 极点之间,导致系统性错误分类。为了解决这个问题,我们引入了一种几何投影,该几何投影仅根据本机语音估计 L1 偏置方向,并在冻结 LID 头部之前将其删除。在五个 MMS-LID 模型和非母语语料库中,该投影极大地改进了 L2 口音语音的目标语言识别,同时保留了对母语语音的预测。这些结果表明,口音引起的 L1 偏差可以在表示空间内直接纠正,无需 L2 训练数据或模型调整。