论文
迈向真正的多语言 ASR:将语码转换 ASR 推广到未见过的语言对
Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs
摘要
自动语音识别(ASR)已成为人类与人工智能交互的关键技术。然而,由于跨不同语言对的多语言 CS 语音资源严重匮乏,语码转换 ASR (CS-ASR) 仍然特别具有挑战性。现有方法主要通过合成 CS 语音生成或有限双语数据集上的特定对 微调 来提高 CS-ASR 性能。然而,这些方法面临着固有的可扩展性限制,因为必须针对语言对单独开发对 CS 的支持,而语言对的数量随着支持的语言数量的增加而增长。在这项工作中,我们研究了从有限的已知语言对中学习到的 CS 功能是否可以通过模型合并和领域泛化方法泛化到未见过的语言对。我们的实验表明,合并的双语 CS-ASR 模型可以适度地推广到未见过的语言对,这表明双语 CS 功能在语言对之间的迁移有限。