论文

BuzzASR:100 多个单语语音识别模型群

BuzzASR: A Swarm of 100+ Monolingual Speech Recognition Models

模型训练监督微调与指令调优

摘要

我们推出了 BuzzASR,这是一组专门针对语言进行微调的 Whisper 模型,适用于 102 种语言的自动语音识别 (ASR)。基于 Transformer 的大型端到端 ASR 模型(例如 Whisper)已经彻底改变了 ASR,但大多数突出的模型都是高度多语言的。因此,这些模型通常在训练集中代表性较差的语言上表现不佳。虽然人们早就知道可以通过单语言数据上的简单 微调 来实现有效的语言适应,但这种策略仅应用于少数语言。我们将这种简单的方法大规模扩展到 FLEURS 数据集中涵盖的 102 种语言,同时还实施了更复杂的语言适应策略,该策略使用纯文本 微调 集成了单语言分词器替换和数据增强。 BuzzASR 模型在 102 种语言中的 77 种上优于 Whisper-large-v3,将字符错误率 (CER) 平均降低了 2.8 以上。我们的模型在 FLEURS 和 Common Voice 组合测试集上针对 102 种语言中的 27 种语言在开源系统中实现了最先进的 CER。与 Whisper 的多语言 BPE 相比,我们的标记器替换策略的压缩率(每个标记的字符数)平均提高了 3.3 倍,增益高达 21.7 倍。我们发布所有模型、代码和详细结果:https://lemn-lab.github.io/buzz-asr