论文

ks-pret-5m:500 万个单词、1200 万个标记的克什米尔语预训练数据集

ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset

AI 基础设施数据基础设施

摘要

我们提出了 KS-PRET-5M,这是最大的克什米尔语言公开预训练数据集,包含 5,090,244 (5.09M) 个单词、27,692,959 (27.6M) 个字符以及 295,433 (295.4K) 个独特单词类型的词汇表。我们从两个来源类别中组装了数据集:数字化档案和文学材料,包括文学、新闻、传记、小说、诗歌、宗教学术和学术写作,使用 Malik~\cite{malik2024inpage} 转换器从专有的 InPage 桌面出版格式中恢复,以及从克什米尔语言网络来源收集的 Unicode 原生文本。所有文本均通过 11 级清理管道进行处理,平均克什米尔文字比率达到 0.9965,将整个数据集中的梵文污染减少到 146 个字符。我们使用 google/muril-base-cased 对数据集进行经验标记,产生每个单词 2.383 个标记的子词比率,总共约 1213 万个子词标记,大大高于之前从非克什米尔波斯-阿拉伯语类似物得出的估计。 KS-PRET-5M 在 CC~BY~4.0 下作为单个连续文本流发布,以支持克什米尔语的语言模型预训练、分词器训练和计算语言研究。