论文
ReScraper:统一抓取和清理 Web 数据,以实现有效的 LLM 预训练
ReScraper: Unified Scraping and Cleaning of Web Data for Effective LLM Pretraining
摘要
LLM 预训练语料库通常是通过一堆手写启发式清理的。启发式抓取工具从 HTML 中提取主要内容,然后由数十个基于规则的过滤器对其进行清理,因此语料库的质量受到规则的粗糙度和准确性的限制。在这项工作中,我们提出了 ReScraper,一个只有 0.6B 参数的统一语言模型,可以取代整个堆栈。为了训练 ReScraper,我们仔细地从三个教师模型的输出中整理监督数据,因此它学会首先从原始数据中提取主要内容,然后在四种操作中进行选择:保持提取的页面、编辑掉嘈杂的行和跨度、完全删除它,或者在写得不好但内容丰富时重写它。基于相同的爬取数据池,在我们策划的数据上预训练 400M、1.4B 和 2.8B 模型,与每个规模的最强基线(包括昂贵的多Agent策划)相比,DCLM Core 得分相对提高了 3.8--4.7%。我们的分析表明,每个操作都发挥着独特和互补的作用,并且一个模型中的提取和清理优于一系列单独模型的效果。 ReScraper还将操作集中在需要它们的页面上,最大限度地提高较差页面的质量,同时保持语料库的多样性。这些结果证明了 AI4AI 用于预训练数据管理的可行性和有效性,其中一个小型学习模型接管了手写启发式流程的整个阶段。我们在 https://github.com/cxcscmu/ReScraper 开源我们的代码