论文

数据过滤的惨痛教训

A Bitter Lesson for Data Filtering

模型训练预训练

摘要

我们通过针对高计算、数据稀缺状况的新扩展研究来研究大型模型预训练的数据过滤。尽管人们普遍认为过滤数据以仅包含高质量信息是必要的,但我们的实验表明,只要有足够的计算,最好的数据过滤器就是没有数据过滤器。我们发现经过充分训练的大参数模型不仅可以容忍低质量和干扰性数据,而且实际上可以从名义上的“不良”数据中受益。