论文
中心还是边缘:通过 Web Graph Centrality 进行预训练数据选择
Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality
摘要
现代语言模型的性能很大程度上取决于预训练数据的组成。然而,现有的数据选择方法依赖于辅助分类器进行文档评分或混合优化,增加了计算开销和对标记数据的依赖。我们提出了 WebGraphMix,一个轻量级的数据选择框架,它计算 Common Crawl 主机级网络图的结构中心性分数,并使用它们来改变预训练混合物中中心文档与外围文档的比例。我们假设中央主机将模型暴露给可重用的抽象,而外围主机则编码专门的长尾知识。 WebGraphMix 在网络规模上高效计算中心性分数,不需要 模型训练、标记数据或下游监督。我们将 WebGraphMix 集成到 DataComp-LM 管道中,并分别使用 8B 和 28B 词元以 400M 和 1B 参数规模训练模型,评估从事实知识到符号推理的 23 项任务。我们的实验表明,中心和外围网络区域编码互补的功能。以 1:1 的比例组合两者的混合物平均达到 41.4%,而均匀采样的平均达到 39.8%。将结构分数与文档级质量分类器分数相结合,将性能进一步提高至 43.8%。这些发现表明,网络图拓扑对于预训练数据管理来说是一个有意义的轴,它捕获的信息在很大程度上与现有的基于内容的方法正交。