论文
用于跨语言低资源 ASR 的顺序适配器堆叠
Sequential Adapter Stacking for Cross-Lingual Low-Resource ASR
摘要
将大规模多语言自动语音识别 (ASR) 模型扩展到资源匮乏的语言仍然具有挑战性。模型性能偏向于高资源语言,而对于标记数据和预训练暴露有限的语言,模型性能会急剧下降。为了解决这个问题,我们研究了参数有效的方法,用于在 Whisper 上将知识从资源丰富的源语言转移到资源匮乏的目标语言。除了热初始化和基于注意力的融合之外,我们还提出了顺序适配器堆叠,它将可训练的目标语言适配器放置在冻结的源语言适配器之上。在受控实验下,这些方法在 Whisper 不支持的三种目标语言(阿斯图里亚斯语、阿萨姆语和科萨语)上进行评估,使用具有不同程度相关性的源语言。与最接近相关源的顺序适配器堆栈始终显着优于跨三个目标的完全微调,相对 WER 减少 5--8\%。仅用一小时的目标训练数据,这些收益就基本上持续存在。