论文
多语言语音识别的词元合并:跨模型规模和微调的系统研究
Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning
摘要
Whisper 等领先的多语言语音识别模型可以转录多种低资源语言,无需进行特定于语言的训练,但部署的计算成本很高。词元合并通过动态组合冗余特征来缓解这种低效率,缩短推理过程中的序列长度,而无需重新训练。在本文中,我们系统地评估了 Whisper 模型系列上十六种不同语言和三种不同模型大小的词元合并。我们还测试了词元合并如何与低资源语言上的微调(DoRA)交互。我们的研究结果表明,合并标记可以提高计算效率,并且在大多数资源匮乏的语言和模型大小中几乎不会损失转录准确性,并且即使在模型经过微调后它也能发挥作用。我们的结果表明,词元合并是一种非常实用的方法,可以使多语言语音识别更快、部署成本更低。