论文
SomaliWeb v1:经过质量过滤的索马里语网络语料库,具有匹配的分词器和公共语言识别基准
SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
摘要
索马里语是非洲之角的库希特语言,约有 2500 万使用者,但尚未公开发布带有配套标记器和语言识别基准的专用索马里语预训练语料库。现有的索马里语文本要么出现在多语言发行版(HPLT v2、CC100、MADLAD-400、OSCAR、mC4)中,要么出现在 Hugging Face 上上传的小型、未记录的索马里语文本中。我们引入 SomaliWeb v1,这是一个经过质量过滤的索马里语语料库,包含 819,322 个文档(约 3.03 亿个词元),通过六阶段可复制管道从三个上游来源(HPLT v2、CC100、索马里维基百科)构建。我们发布了 (i) 语料库,(ii) 匹配的 BPE-16K 分词器,以及 (iii) 三种生产语言标识符的第一个公开并行索马里语基准。我们的测量揭示了现有发行版中的具体质量缺陷:HPLT v2 的“清理”索马里语版本保留了 17.3% 的字节精确重复项,其文档的 56.1% 包含可修复的 mojibake,并且在 Jaccard tau=0.80 时,其字节唯一文档的 10.7% 接近重复。作为标记器级别的测量,我们的 BPE-16K 标记器在 FLORES-200 Somali devtest 上发出的标记比 GPT-4 的 cl100k_base 少 40.2%;下游语言模型困惑度比较推迟到后续版本。