论文

GigaAM 多语言:代表性不足的语言的基础模型

GigaAM Multilingual: Foundation Model for Underrepresented Languages

模型训练预训练

摘要

尽管最近在扩展方面取得了成功,但多语言 ASR 的性能仍然非常不平衡,长尾语言严重缺乏数据。这项工作解决了为代表性不足的中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)建立强大的基础模型的挑战。我们推出了 GigaAM Multilingual,这是一种使用 HuBERT 式目标对 200 万小时音频进行预训练的 Conformer 编码器。至关重要的是,我们在 预训练 期间引入了集群级数据平衡策略,并在 微调 期间引入了域感知采样方法,以减轻头语言的主导地位。在受控比较中,我们的方法在目标语言上优于强大的开放式预训练编码器(Whisper Large v3、Omnilingual-1B),在保持效率的同时在自发语音方面取得了显着的进步。我们发布了基础编码器和 ASR 模型,为现实数据不平衡下的有效多语言适应提供了经过验证的方法。