论文
大语言模型 预训练的可扩展频率和长度感知子文档重复数据删除
Scalable Frequency- and Length-Aware Subdocument Deduplication for Large Language Model Pretraining
摘要
大规模预训练语料库包含大量重复内容。尽管文档级重复数据删除被广泛使用,但消除子文档级冗余仍然具有挑战性。在语料库规模上,基于后缀数组的方法通常在分片内独立应用,从而不会检测到跨分片重复项,并使最终的保留行为对分片配置敏感。基于哈希的方法可以实现全局精确重复计数,但通常依赖于无法适应异构重复模式的固定副本保留策略。我们提出了一个可扩展的子文档重复数据删除框架,该框架将重复检测与副本保留分离。它通过自然边界分割、标准化精确散列和分布式聚合来识别重复组,然后应用明确的频率和长度感知保留策略,为每个组分配自适应副本预算,保留更多低频或短重复副本,同时更积极地删除高频或长重复副本。 FineWeb-Edu 和包含代码的网络语料库上的实验表明,使用我们的方法处理的数据训练的模型在评估的设置中实现了最佳的整体性能。这些结果强调了显式复制保留控制的重要性。