论文

Dolphin-CN-Dialect:中文方言的重要性

Dolphin-CN-Dialect: Where Chinese Dialects Matter

模型训练预训练

摘要

我们推出了 Dolphin-CN-Dialect,这是一种具有流媒体功能的 ASR 模型,重点关注中文和方言丰富的场景。与之前的版本相比,Dolphin-CN-Dialect 在数据处理、标记化、训练稳定性和数据采样策略方面引入了实质性改进。为了解决方言数据高度不平衡的挑战,我们提出了一种基于温度的采样策略,可以有效平衡标准普通话和低资源方言,从而显着提高方言识别性能。此外,我们重新设计了标记器,以更好地符合语言特征,对中文采用字符级建模,对英语采用子词建模,同时引入可扩展的方言标记。实验结果表明,与Dolphin相比,Dolphin-CN-Dialect在方言识别准确率和CER降低方面取得了提升。此外,Dolphin-CN-Dialect 与最新的 SOTA 开源 ASR 模型相比达到了具有竞争力的性能,同时保持了较小的模型大小。 Dolphin-CN-Dialect 支持流式和非流式推理,实现延迟和准确性之间的实际平衡。它还通过热词支持和针对专用硬件优化的高效部署来提供灵活的定制。这些改进使 Dolphin-CN-Dialect 成为现实世界多方言 ASR 应用程序的强大且实用的解决方案。