论文
WorldSpeech:来自世界各地的多语言语音语料库
WorldSpeech: A Multilingual Speech Corpus from Around the World
摘要
自动语音识别 (ASR) 对于具有大量配对音频转录数据的高资源语言表现良好,但由于公开可用的对齐数据有限,其准确性对于大多数语言而言急剧下降。为此,我们推出了 WorldSpeech,这是一个 24 kHz 多语言语音语料库,包含 76 种语言的 65,000 小时对齐音频转录数据,这些数据是从议会程序、国际广播和公共领域有声读物等不同公共来源收集的。 WorldSpeech 为 37 种语言提供超过 200 小时的对齐语音,其中 28 种语言超过 500 小时,24 种语言超过 1000 小时。 微调 WorldSpeech 上现有的 ASR 模型使 11 种类型不同的语言的平均相对词错误率降低了 63.5%。