论文
CuraWeb:面向网络规模预训练数据的质量、冗余与多样性联合优化
CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data
摘要
经FineWeb-Edu、DCLM等高选择性过滤器筛选的开放网络语料构成了LLM预训练数据的核心,并显著推动了LLM性能的提升。然而,这些流水线通常依赖单一优化目标,这不可避免地收窄了分布多样性、边缘化了长尾知识,从而限制了数据覆盖面,未能充分利用开放网络的巨大潜力。为解决这一局限,我们提出一种新颖的数据筛选范式,将线性修剪转变为质量、冗余与多样性的联合优化。该框架将双轨清洗(基于规则与模型驱动)与混合去重(n-gram与语义)相协同,并采用多目标采样器在信息质量与分布广度之间取得平衡。将该框架应用于Common Crawl,我们构建了CuraWeb,一个2T词元的英文语料库。与现有资源不同,CuraWeb通过恢复更具整体性的数据分布——多样性更强、冗余更少——确立了工业级数据筛选标准,在多样化领域实现了对长尾知识更广泛的覆盖。3B规模的实验评估表明,CuraWeb显著优于最先进基线,在广泛基准上平均性能提升1.8%,在知识密集型与推理任务上表现尤为突出。
