论文

用于多语言预训练数据选择的跨语言质量分类器

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

模型训练合成数据

摘要

随着 大语言模型 (LLM) 规模的扩大,数据管理已从最大化数据量转向通过执行质量过滤来优化信噪比。然而,对于许多语言来说,原生高质量数据不足以训练强大的质量分类器。这项工作研究了嵌入空间中的质量标记可能表现出跨语言一致性的想法,这将使高资源语言能够补贴低资源语言的过滤。我们评估各种过滤策略,包括跨语言迁移、第三四分位数采样 (Q3) 和保留率调整。我们的结果表明,对于在 103B 词元上训练的 1B 模型,大规模多语言池在排名稳定性和聚合准确性方面经常优于单语言基线,为高资源语言带来收益(法语的聚合标准化准确性增加 1.2%),并匹配或超过低资源语言的单语言基线。然而,我们发现规模本身并不能保证稳定性。此外,对于法语等高资源语言,我们表明有必要通过第三四分位数采样(Q3)细化决策边界或调整保留率,以充分利用多语言信号。