论文
通用电话识别的经验方法
An Empirical Recipe for Universal Phone Recognition
摘要
电话识别 (PR) 是多语言和低资源语音处理任务的关键推动者,但稳健的性能仍然难以实现。高性能的以英语为中心的模型不能跨语言泛化,而多语言模型则未充分利用预训练的表示。目前还不清楚数据规模、架构和训练目标如何促进多语言公关。我们展示了 PhoneticXEUS——经过大规模多语言数据的训练,并在多语言 (17.7% PFER) 和带口音的英语语音 (10.6% PFER) 上实现了最先进的性能。通过在统一方案下对 100 多种语言进行受控消融评估,我们凭经验建立训练配方并量化 SSL 表示、数据规模和损失目标的影响。此外,我们还分析跨语系、口音语音和发音特征的错误模式。所有数据和代码均在 https://github.com/changelinglab/PhoneticXeus 公开发布