论文

SraVaani 1.0:扩展印度语言的包容性语音识别

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

模型训练预训练

摘要

印度的语言环境涵盖 700 多种语言和数千种方言,但绝大多数自动语音识别 (ASR) 系统仅支持这种多样性的一小部分。我们推出 SraVaani-1.0,这是一种多语言 ASR 模型,涵盖 65 种印度语言和方言,其中许多语言和方言目前没有公开可用或竞争的 ASR 系统。 SraVaani-1.0 基于 FastConformer 架构构建,并从头开始经过三个阶段进行训练。第一阶段,我们使用对比学习目标对 VAANI 语料库中 31,255 小时的未标记语音进行自我监督预训练。在第二阶段,我们引入了音频图像表示对齐阶段,该阶段利用 VAANI 语料库中可用的配对图像和语音。这种多模态对齐鼓励语音编码器通过利用视觉上下文和口语内容之间的关系来学习语义上更丰富的表示,从而提高下游识别,特别是对于资源匮乏的最后阶段,对齐的编码器使用混合词元和持续时间换能器(TDT)-CTC解码器对从跨越65种语言和方言的24个公共数据集编译的31,263小时的标记多语言印度语音进行端到端微调。我们通过八个基准测试,针对三个最先进的多语言 ASR 系统来评估 SraVaani-1.0。 SraVaani-1.0 在大量语言数据集对上实现了最低的单词错误率 (WER),同时在高资源上与性能最佳的系统保持竞争力。重要的是,它是唯一一个为多种低资源和部落印度语言提供转录功能的开源评估模型,这些语言仅在 VAANI 基准上进行评估。