论文
GPT-NL 公共语料库:LLM 预训练 的许可许可、荷兰首个数据集
GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
摘要
我们推出 GPT-NL 公共语料库,这是最大的荷兰语言资源许可语料库。 GPT-NL 公共语料库包含 21 个仅限荷兰语的集合,总计 36B 个预处理荷兰语标记,任何其他 LLM 预训练语料库中都不存在。此外,该语料库还包括大约 207B 个英语、232B 个代码和 48B 个德语/丹麦语标记,这些标记取自现有集合,我们进一步整理了这些标记以确保合规性。该语料库包括来自 Common Corpus 和 Common Crawl 等大型现有语料库的精选数据,以及新创建的荷兰语特定集合。大多数新创建的荷兰馆藏都包含与组织合作收集的内容或综合增强的内容。收集和评估所有数据的目的是促进创建合法、有用且无害的(商业)语言模型。 GPT-NL 公共语料库中包含的所有数据均来自具有许可许可的数据集,并根据 CC-BY 许可进行整理和重新分发。完整的数据集可在 Hugging Face Hub 上公开获取。