论文
AccentCL:可增量扩展的鲁棒口音分类
AccentCL: Robust Accent Classification with Incremental Expansion
摘要
口音分类器通常使用固定标签库存进行训练,并且随着新数据的出现而无法适应新的口音类别。此外,由于语料库之间的录音条件差异,口音语音语料库经常表现出严重的类别不平衡和/或域转移。我们提出了 AccentCL,一种用于英语口音分类的类增量学习框架,它对类不平衡和跨语料库域转换具有鲁棒性。 AccentCL 从冻结的 Whisper-Large-v3 编码器中提取多层表示,并通过不平衡感知交叉熵损失进行优化,以减少对大多数口音类别的偏差,并使用域均值对齐损失来最小化训练语料库 上的分布均值偏移。然后,通过基于重放的持续学习来扩展标签空间,使用冻结的基础模型来保留知识,并使用从旧到新的边际损失来减少对新添加的类的过度预测。在五级口音分类任务中,AccentCL 实现了 77.1% 的平衡准确率和 76.9% 的宏观平均 F1 分数。我们进一步评估该模型逐步纳入两种新口音类别的能力:西班牙口音和中国口音英语。当将西班牙口音英语添加到预训练模型中时,AccentCL 在新类别上获得了 83.3% 的 F1,同时在基类上保留了 77.3% 的平衡准确率。当随后添加中国口音的英语时,它在新课程上达到了 61.8% 的 F1,同时在之前学习的课程上保持了 77.6% 的平衡准确率。这些结果表明,AccentCL 能够实现强大的区域口音分类,同时允许添加新的口音类别,而无需完全重新训练。
