论文

连接计算和数据优化预训练

Bridging Compute- and Data-Optimal Pretraining

模型训练预训练

摘要

经典的计算最优缩放法则假设新的预训练数据的供应是无限的,但预训练越来越多地进入计算增长速度快于高质量数据的可用性的状态。我们提出了计算数据(CD)缩放法则,这是一个统一的框架,它连接了计算最优缩放和数据最优缩放,其中数据随计算自由缩放,而数据最优缩放则语料库是固定的,而计算可以无限制地增长。 CD 缩放通过引入词元有效性函数 $η$ 扩展了经典的缩放法则,该函数量化了所产生的派生词元的价值,例如,通过多轮重复或相对于新鲜词元的改写,范围从完美替代品到没有价值。我们使用 Dolma-3 语料库将 $η$ 拟合为两种数据扩展策略:多轮重复和改写,模型大小从 14M 到 600M 参数。我们发现词元有效性远非恒定:它共同取决于模型大小、每个参数的词元比率和派生数据量,并且随着语料库的扩展而饱和。 $η$ 的函数形式意味着当用计算代替数据时,随着模型大小或数据可用性的增加,收益递减。它还将训练分为三种操作模式——计算绑定、数据绑定和模型绑定——并表明经典的计算最优分配在大多数实际相关设置中并不是最优的。