论文
维基转储到训练语料库:南斯拉夫案例
Wiki Dumps to Training Corpora: South Slavic Case
摘要
本文提出了一个管道,旨在将原始维基媒体转储转换为七种南斯拉夫语言的高质量文本语料库。工作分为两个主要阶段。第一个涉及从维基百科、维基文库、维基教科书、维基新闻和维基语录的原始转储中提取和清理文本。此步骤需要仔细处理原始 wiki 标记,首先隔离文本文章,然后隔离其中可用的自然语言文本。第二阶段解决了有问题或低质量文章的挑战,这些文章通常是从数据库或结构化知识库生成的。这些文章的特点是重复的模式、通用的措辞以及极少甚至没有原创内容。为了减轻其影响,采用基于 n-gram 的过滤策略来检测文章之间的高水平文本冗余,然后从语料库中完全删除此类文章。由此产生的数据集旨在提供语言丰富的文本,适合训练语言模型或进行南斯拉夫语言的比较研究。通过将系统提取与质量控制相结合,这项工作有助于创建可靠的、高信息量的语料库,反映语言的真实文化背景。虽然本文重点关注南斯拉夫语案例,但该方法主要与语言无关,并且可以推广到其他语言。