论文

Latent Softmax:面向声调与非声调语言的数据高效多语音素识别

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

模型训练监督微调与指令调优

摘要

基于音素的多语言自动语音识别 (ASR) 可以比特定于语言的子词建模更直接地跨语言共享声学证据。然而,当声调和非声调语言联合训练时,它们的监督粒度不匹配:声调语言注释声调标记元音,而非声调语言通常仅提供基元音标签。标准的 softmax 要么将两者视为不相关的类,从而削弱跨语言共享,要么破坏声调,失去声调语言所需的区别。我们提出 Latent Softmax,这是一种与连接主义时间分类 (CTC) 兼容的输出层,它将音调标记元音建模为子类,将基础元音建模为主要类,而辅音和 CTC 空白仍然是单例标签。当仅观察到基元音大类标签时,声调标记的元音子类被视为潜在的并被边缘化。对 AISHELL-1 普通话和 LibriSpeech 英语进行的多语言实验表明,与标准 Softmax 多语言基线相比,Latent Softmax 在 AISHELL-1 上将语音到音素 (S2P) 音素错误率降低了 8.4%,在 LibriSpeech test-clean 上降低了 17.5%,在 test-other 上降低了 12.6%。改进的语音到音素编码器还为大语言模型音素到字素转换和基于投影仪的界面带来一致的单词错误率增益。经过代码转换适应后,Latent Softmax 进一步将 ASRU2019 上基于投影仪的混合错误率降低了 2.6%,在 CS-Dialogue 数据集上降低了 9.5%。