论文

重复优于多样性:用于样本高效德语建模的高信号数据过滤

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

模型训练合成数据

摘要

最近的研究表明,将海量英语网络语料库过滤成高质量的子集可以显着提高训练效率。然而,对于德语、法语或日语等资源丰富的非英语语言,激进的过滤会造成战略困境:从业者是否应该通过对大量轻度过滤的网络数据进行一次训练来优先考虑多样性,或者通过严格过滤高质量核心并在多个时期重复来优先考虑质量?我们通过构建应用于 5 亿个 Web 文档的分层质量过滤器来研究德语的这种权衡,将过滤子集上的多轮训练与不同语料库上的单通道训练进行比较。我们在多个模型尺度和 词元预算 上进行的实验表明,在较大、过滤较少的数据集上,重复高质量数据始终优于单遍训练。值得注意的是,即使在 7 个 epoch 之后,性能差距仍然存在。我们的研究结果表明,对于非英语 LLM,通过质量过滤进行语义集中比简单地最大化唯一数据量提供了更可行的高效语言建模途径。我们向研究界发布了德语模型(称为 Boldt)以及经过清理的评估基准。我们的实验表明,尽管训练的 token 比同类模型少 10-360 倍,但它们仍取得了最先进的结果。