论文

采用英语质量分类器进行多语言 LLM 预训练数据选择

Adapting English Quality Classifiers for Multilingual LLM Pretraining Data Selection

模型训练合成数据

摘要

大语言模型 (LLM) 预训练的最新进展凸显了高质量训练数据在提高性能方面的作用。虽然基于模型的过滤已被证明可以有效地从网络规模的语料库中选择高质量的子集,特别是对于高资源语言,但由于注释数据的可用性有限,低资源语言面临着挑战。这项工作通过提出一种多语言适应方法,将现有的英语质量分类器转换为多语言变体,探索将质量过滤扩展到 100 多种语言。我们的方法建议在 Transformer 仅编码器模型嵌入之上训练一个小型多层感知器,使用多语言文本作为输入,并使用从应用于机器翻译文本的英语分类器获得的分数作为标签。我们的 1B、3B 和 8B 规模实验表明,我们的方法保持了现有的基于多语言模型的过滤基线的下游 LLM 基准性能,而不损害区域和文化知识基准。为了进一步评估跨语言泛化,我们比较 高质量合成数据和网络样本的分类器分数,以及分类器分数与基于LLM的分类器分数的相关性,表明分类器可以学习其原始英语变体的评分标准,即使对于未包含在其训练数据中的语言也是如此。