论文

大规模印度语口语识别的预训练语音编码器和训练目标的比较研究

A Comparative Study of Pre-trained Speech Encoders and Training Objectives for Large-Scale Indic Spoken Language Identification

模型评测模型能力评测

摘要

印度语言的口语识别(LID)是一个具有挑战性的问题,因为印度语言数量众多,相关变体之间存在显着的语音重叠,并且许多资源匮乏的语言缺乏标记数据。在这项工作中,我们对两种预训练的语音编码器(Whisper 和 FastConformer)与线性分类器进行了系统的比较研究,用于跨越四个语系的 42 种语言的大规模印度语 LID。我们在冻结(线性探测)和微调设置下评估这两种编码器,并比较三个训练目标:交叉熵(CE)、交叉熵监督对比损失(CE + suCon)和分层softmax(HSM)。模型在 Vaani 数据集上进行训练,并在 Vaani-Test(held-out)、FLEURS 和 Kathbath 上的跨语料库设置中进行评估,从而提供对领域泛化的见解。冻结的 FastConformer 编码器在 FLEURS 和 Kathbath 上实现了超过 90% 的宏准确度,无需任何特定于任务的适应,在域外基准测试上大大优于 Whisper,而经过微调的 Whisper 可以产生更强的域内性能。对于这两种编码器,HSM 在所有基准测试中始终优于 CE 和 CE+SupCon,并且在域外测试集上的增益最大。 CE+SupCon 降低了 FastConformer 的跨语料库泛化能力,表明对比目标对域内条件的表示过度专业化。按科分析表明,中部印度-雅利安语变种是最难区分的,印地语-乌尔都语和萨德里-恰蒂斯加尔希-苏尔古加语群是主要的混淆对。