论文
Thiomi 数据集:资源匮乏的非洲语言的大规模多模态语料库
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
摘要
我们提出了 Thiomi 数据集,这是一个大型多模态语料库,涵盖四个语系的十种非洲语言:斯瓦希里语、基库尤语、坎巴语、基梅鲁语、洛语、马赛语、基普西吉斯语、索马里语(东非);沃洛夫语(西非);和富拉尼(西非/中非)。该数据集包含超过 601,000 个经过批准的句子级文本注释和超过 385,000 个录音,这些录音是通过涉及 100 多名贡献者的专用社区数据收集平台收集的。为了验证数据集的实用性,我们训练和评估 ASR、MT 和 TTS 模型,建立跨所有语言的基线。我们最好的 ASR 系统在斯瓦希里语(通用语音)上实现了 3.24% 的 WER,将之前的学术 SOTA 从 8.3% 减少到 3.24%(绝对值 5.1 个百分点,相对减少 61%),在索马里语上实现了 4.3% 的 WER。该数据集将发布在 HuggingFace 上。我们描述了收集平台、质量保证工作流程和基线实验,并讨论了对非洲语言技术基础设施的影响。