论文

用杠杆分数采样扩展语言模型预训练的数据多样性

Towards Scalable Data Diversification for Language Model Pretraining via Leverage Score Sampling

模型训练预训练

摘要

语言模型预训练的数据选择面临着质量和多样性之间的根本张力。虽然质量过滤在经验上是有效的,但它经常会导致多样性崩溃:通过偏爱与高质量参考语料库(例如教育或质量保证型数据)类似的文本,它系统地排除了来自代表性不足的领域的有价值的数据。相比之下,多样化选择可以保持域平衡并鼓励强大的下游性能,但现有方法要么专注于间接增强多样性的覆盖导向目标,要么通过限制可扩展性的昂贵的协方差矩阵重新计算来直接优化多样性。为了解决这些问题,我们引入了 \textbf{Leverage Score Sampling (Lev)},它迭代地选择通过杠杆分数最大程度地扩展嵌入数据的决定性体积的样本,这是一种计算高效的标准,可以消除矩阵重新计算并实现可扩展的选择。根据经验,Lev 提供高达 72\times$ 的加速,并提高了数据集多样性(通过 Vendi 分数衡量),比强大的多样化基线 \textbf{DiSF} 提高了 $9.2\%$。在 CommonCrawl (CC) Web 数据选择方面,Lev 将七个下游任务的准确性比现有基线提高了高达 1.31\%$。对于本质上难以定义稳健质量标准的领域(例如代码),Lev 可以作为一种有效的无监督管理替代方案:在 StarCoderData 上,所选子集比 DiSF 的每字节位数减少了 3.08\%$。值得注意的是,我们发现了质量过滤的跨域崩溃:由 DCLM-fastText 过滤的 CC 数据无法保留足够的代码相关内容,导致相对于 Lev 选择的数据产生较差的代码性能。这些发现主张将多样性意识实践整合到质量过滤中,以便在语言模型预训练中更有效地管理数据。