论文
DataOrchestra:学习编排预训练数据的每个示例管理
DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data
摘要
预训练数据处理对于大语言模型(LLM)的下游性能至关重要。然而,许多现有方法在语料库或领域级别定义固定的处理策略,并将其统一应用于许多示例,而没有适应每个示例的需求。我们提出了 DataOrchestra,这是一个统一不同处理操作并为每个示例编排特定于示例的管道的框架。给定一大块预训练数据,编排器决定是否删除、不触及或清理它。对于要清理的块,它选择一个或多个下游操作,范围从编程编辑到基于 LLM 的不同形式的重写。对于每个重写步骤,它进一步生成一条具体指令,由相应的下游工具模型执行。我们在 DataOrchestra 处理的 Web 数据上从头开始预训练从 0.5B 到 7B 的模型,并在 11 个基准测试中观察到相对于单个数据处理方法的稳定平均增益。 DataOrchestra 对于数学持续预训练也很有效,并且性能优于更强的处理基线,同时通过跳过不必要的下游操作来减少处理计算。