释放潜在价值:分类指导下从低层 Web 语料库中恢复高性能数据
Unlocking Latent Value: Taxonomy-Guided Recovery of High-Performing Data from Low-Tier Web Corpora
摘要
用于预训练的主要网络数据管理管道将文档质量压缩为单个综合分数,系统性地遗漏了评分者低估的维度上的高价值内容。我们提出了一个分类驱动的框架,该框架通过沿着复合分数无法捕获的语义有意义的维度进行过滤来恢复该值。首先,在 ESSENTIAL-WEB 分类法的基础上,我们引入了两个新颖的维度:及时性和文化特异性,这两个维度都显示出与现有 NMI 较低的成对 NMI。我们使用 Qwen2.5 32B 注释 14M 文档,并提炼成轻量级 0.5B 模型。为了实现语料库范围内的快速注释,我们还在 E5 嵌入上训练了 73M 多任务 MLP,实现了 50 倍的推理吞吐量。其次,为了驾驭滤波器配置的组合爆炸,我们引入了一个计算效率高的双通道框架:第 1 通道识别小规模下最强的维度信号;第 2 遍构建并评估表现最佳的合取和析取复合滤波器 - 以完全缩放定律成本的一小部分识别高性能配置。将选定的过滤器应用于非优先级的 Web 数据,经过分类过滤的子集的性能优于未过滤的基线,甚至超过最高质量层。在中层数据上,我们的最佳过滤器在推理方面比未过滤的基线提高了 12.1%,在编码方面提高了 9.5%,在知识基准方面提高了 2.0%,在推理方面比未过滤的顶级数据提高了 6.7%,在编码方面提高了 13.7%。此外,低于典型生产阈值的两层过滤后的数据在推理方面比未过滤的基线提高了 22.3%,在编码方面提高了 19.5%,超过了编码基准的顶级数据。这些结果表明,巨大的潜在价值仍然被锁定在非优先级的网络数据中,而多维分类过滤是解锁它的有原则的、计算高效的关键。