论文

重复的token值多少钱?多时期预训练的缩放几何

What Is a Repeated Token Worth? The Scaling Geometry of Multi-Epoch Pretraining

模型训练预训练

摘要

随着预训练越来越多地重复数据,每次运行都面临三个问题:需要多少个 epoch,该数字应如何随模型大小而变化,以及除了 epoch 计数之外的其他因素是否重要。我们通过根据两个参考对重复的token进行定价来回答这些问题:相同数据的一个时期(给出其价值)和同等计算的新鲜数据(给出其成本)。针对新数据,重复成本遵循单个变量,即额外纪元的数量除以每个参数的唯一token。根据相同的数据,第二个纪元的价值几乎与新纪元的价值相同,并且在关键纪元计数之后,重复的token的价值会下降到新纪元的一半,该关键纪元计数随着每个参数的训练预算的增长而增长,但与模型大小的关系不大。在固定唯一数据的情况下,预测的计算最佳运行会同时增加模型大小和历元,直到损失停止改善,接近关键历元计数。相同的变量解释了似乎冲突的大小趋势的方向:当语料库固定时,较大的模型容忍更少的时期,从 127M 的大约 15 到 2B 参数的 4,但当唯一数据随模型增长时则不能容忍。计数本身并不能决定损失:在相同的计数下,连续重放分片会使损失增加高达每字节 0.46 位,将重复集中在较少的样本上也会增加损失,低熵源随着重复而退化得更快,而重新标记重复仅在大量重复时才有帮助。当唯一数据(而不是计算)成为约束约束时,这些结果为预训练提供了经验指导。

重复的token值多少钱?多时期预训练的缩放几何的原论文方法或结果图
图 1:超额损失随着额外 epoch 的增加而增加,并随着参数的独特数据而减少;在固定唯一数据的情况下,预测的计算最佳运行在重复值相当于新鲜token一半的点附近达到最低损失。 CommonCrawl 网格(§4)。 (a) 留出在 $U=0.5$B 上的唯一token损失超过训练token $D=RU$ 和模型尺寸 $N$,来自单周期拟合加上方程 1。 (3)、在网格范围内(灰色,训练token每参数,TPP $=D/N$,5以下);垂直线标记时代。红色,计算最优分配(每次计算 $C=6ND$ 时的损失最低,第 4.4 节);浅虚线,相等的计算线;黑色虚线,同样的最小化与单周期拟合,就好像每一个重复的token都值得一个新的($\eta=1$); star,$U$ 中的最低损失,超过该值更多的计算会增加损失(褪色)。虚线表示方程的临界历元计数 $R_{c}$。 (4),超过这个值,重复的token的价值还不到新鲜的一半($\eta<\tfrac{1}{2}$,等式 1)。最优值将 TPP 保持在 16 到 22 之间,低于新鲜数据 25,并在 5.3 个 epoch 时达到最低损失,其中 $R_{c}\approx 5.3$。 (b) 对于高于 0.002-bpb(位/字节)分辨率阈值的 140 个重复配置中的 113 个,在同等计算(等式 2)下相对于 $z=(R-1)N_{\rm total}/U$ 的新鲜数据存在过多损失;虚线,等式。 (3)。每个尺寸的地图和关键纪元计数如图 4 所示。