论文

Neyshekar:用于自动语音识别的开放式波斯语朗读语料库

Neyshekar: An Open Persian Read-Speech Corpus for Automatic Speech Recognition

模型评测基准与评测资源

摘要

Neyshekar 是一个开放的波斯语阅读语音语料库,旨在涵盖正式和非正式语言、命名实体和较长的话语。在版本 6 中,190 位贡献者提供了 62,279 条经过验证的录音,总计 99.02 小时,其中包含 34,541 条不同的录音提示。提示池由人工编写的材料、上下文同形异义词和经过审查的语言模型生成的文本组装而成。文本条目通过 shekar 库进行标准化,该库支持正式和非正式的波斯语,并且每个提交的录音都根据通用验证规则进行审查。大约 24% 的已发布剪辑被自动分类器归类为非正式剪辑;这些寄存器标签未经人工验证。提供项目级评分者标签用于可重复的一致性估计,不透明的每个剪辑贡献者标识符使说话者不相交分区可审核并支持贡献者聚类不确定性估计,并且包含文本不相交测试子集用于超出先前看到的提示的评估。每个发布的剪辑都具有每个贡献者的录制负载和无参考信号质量的特征。在共享处理下将语料库特征与波斯语通用语音进行比较。通过两个 ASR 架构、三个优化种子 WER 和 CER 以及对公共 PSRB 样本的独立评估来评估效用。与大约 32 小时的持续时间匹配的 Common Voice 训练相比,Whisper 的域内 WER 降低了 9.5 点,XLS-R 降低了 11.6 点,在独立 PSRB 样本上,两种架构的域内 WER 降低了大约 8 点。跨架构和训练预算并没有一致地观察到转移和混合的好处。语料库在CC0下发布;代码和数据可通过项目存储库获取:https://github.com/amirivojdan/neyshekar。