论文

多语言语音模型中的语音干扰

Phonological Interference in Multilingual Speech Models

模型评测应用与实践模型行为与机制分析鲁棒性、公平性与可信度评测语音交互与综合语音服务

摘要

音素级模型将语音转录或生成为音素序列,音素是区分单词的最小声音单位。这些模型可以实现细粒度的发音控制和理解,但通常会在与任何单一训练语言不匹配的输入上失败,例如两种语言之间的语音交替(称为语码转换)或训练中缺少的低资源语言。我们确定了这背后的系统性故障模式,即语音干扰:模型假设输入是单一语言并强加其语音,从而覆盖与假设语言冲突的本地音素级决策。我们通过模型保留一种语言具有而另一种语言缺乏的音素的频率来衡量干扰。在代码切换输入中,两个电话识别器(语音到音素模型)和一个音素条件文本到语音模型会丢失 32% 到 79% 的音素,但丢失两种语言共享的音素要少得多。对于看不见的语言,我们发现电话识别器将它们分配给语音的训练语言的音系强加给语音,并且更加自信 作业中,他们丢失的音素就越多,而未见过的语言具有但指定的语言却缺少的音素。我们从模型的内部激活中探测模型的语言估计,并追踪对低维子空间的干扰。在单语语音中,将该子空间转向另一种语言会使模型丢失只有原始语言使用的音素,并产生只有目标语言才有的音素。我们引入了窗口语言估计(WLE),这是一种推理时间修复,它将模型在该子空间中的语言估计替换为根据每个位置周围的短窗口计算的语言估计。在代码切换输入上,WLE 消除了所有三个模型中 34% 到 69% 的干扰,并且在识别器中,它使单语言性能基本保持不变。