论文
语种识别的声学域迁移:从受控实验到MMS-LID验证
Acoustic domain shift in spoken language identification from systematic domain generalization evaluation to real-world application
摘要
域泛化旨在开发面对训练未见条件仍稳健的模型。计算机视觉已通过受控基准与多种分布迁移系统研究域泛化,但口语语种识别的评测仍不够结构化。现有语音数据集为真实声学条件下的鲁棒性提供有价值基准,但主要围绕特定场景和大规模数据设计,而非作为系统构建与评估域迁移的通用工具。本文提出一个小规模语音数据集和评测协议,用于受控研究声学域迁移,可在多种声学迁移条件下评估语种识别模型。我们把语音模态引入DomainBed域泛化框架,并评估三种域泛化算法。结果显示,域内表现不能可靠预测跨域鲁棒性;显式域不变算法,如MMD或DANN,并不优于ERM。我们还在先进语种识别系统MMS-LID-126上验证这些发现的普适性,并发布代码。