论文

KletterMix:迈向高质量的德国预训练数据 - 完整报告

KletterMix: Climbing Toward High-Quality German Pretraining Data - The Full Report

模型训练合成数据

摘要

高质量的预训练数据是现代语言模型的核心组成部分,但德语资源的开发程度仍远低于英语资源:它们通常较小、管理不那么仔细、记录薄弱,并且很少通过受控训练实验进行验证。我们介绍 KletterMix,这是一个用于语言模型预训练和退火的高质量德语语料库,旨在作为自然语言处理和建模社区的可重用数据集工件。 KletterMix 是通过将最先进的英语预训练语料库翻译成德语而构建的,同时保留文档边界、元数据、源结构和主题多样性。这种构建产生了一个具有现代预训练数据集规模和多样性的德语语料库,同时可以与其英语源进行直接比较。我们通过一系列广泛的语料库级别分析来记录数据集,包括翻译质量、文档长度分布、主题覆盖范围、来源构成和地理元数据。使用 COMETKiwi,我们表明翻译的文档在不同领域都达到了很高的质量,这表明仔细的翻译可以保留原始语料库的大部分语义和风格丰富性。除了数据集构建之外,我们还将 KletterMix 作为训练数据进行评估。通过针对已建立的德语语料库进行受控预训练和退火消融,我们表明在 KletterMix 上训练的模型在德语下游评估方面取得了可衡量的改进。这些结果表明,精心策划的翻译数据可以大大加强德国预训练数据生态系统。