论文

从语音到文本语料库:评估资源匮乏的丰贝语和豪萨语的基于 ASR 的数据采集

From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

应用与实践语音识别与转写

摘要

资源匮乏的非洲语言缺乏语言 模型训练 所需的文本语料库。我们研究 ASR 管道是否可以扩展两种类型不同的西非语言的文本资源:丰贝语(音调,变音符号丰富)和豪萨语(非音调)。我们在精心策划的 12.3 小时 Fongbe 数据集上对 MMS-300M 进行微调,在 ALFFA 基准上实现了 9.48% 的 WER,比之前的 44.04% 基线相对减少了 78%,同时保留了对语言至关重要的音调变音符号。对于豪萨语,我们应用现有的微调 Whisper-Small 模型。我们对 1,553 个 YouTube 视频(236 小时)进行了编目,并处理了 424 个视频(45.49 小时)的子集,这些视频被选择来平衡领域多样性与可用计算资源,产生 6,770 个转录片段。对每种语言 50 个随机采样片段进行的人工评估显示,豪萨语的平均质量得分为 57.4/100,Fongbe 的平均质量得分为 36.5/100,这表明虽然豪萨语转录达到了语料库构建可接受的质量,但 Fongbe 转录需要进行后处理或改进模型以供生产使用。我们按照平台条款和道德准则发布精选数据集、微调模型、转录语料库和完整视频目录。