论文
语言辨别改善多语言语音模型中的语言学习
Language Discrimination Improves Linguistic Learning in Multilingual Speech Models
摘要
多语言自监督语音模型可以从跨语言共享信息中受益,但在匹配的总预训练数据预算下,它们仍然达不到单语言模型。我们表明,在预训练期间增强模型区分语言的能力可以减少并在某些方面缩小连续语音和高级语言测量方面的多语言差距,同时保留大量的跨语言共享。使用受控的英语/法语 HuBERT 设置,我们测试了两种加强语言歧视的干预措施:辅助语言分类器和每种语言的 k 均值目标。在干预措施中,连续特征音素辨别错误(phone-ABX,越低越好)从双语基线的 11.6% 下降到 10.4%(单语:10.8%),而词汇表现(sWUGGY,越高越好)从 52.1% 增加到 56.7%(单语:58.5%),韵律表现(ProsAudit,词汇子任务,越高越好)更好)从 68.9% 到 72.9%(单语:72.6%)。在 HuBERT 训练阶段,大多数语言测量的最大收益发生在第一次迭代中引入语言歧视时,而后来或重复的干预产生的改进较小,并且伴随着语言隔离的增加。这些结果支持语言歧视在降低多语言学习的额外成本方面的因果作用。