论文

数据约束语言模型预训练:改进的正则化和缩放定律

Data-Constrained Language Model Pretraining: Improved Regularization and Scaling Laws

模型训练预训练

摘要

语言模型预训练的经典缩放法则在固定计算预算下平衡模型大小与训练数据集大小,假设数据丰富且对语料库进行单次传递。由于训练计算的增长速度快于自然语言数据的供应,预训练可能会进入数据受限、计算丰富的状态,其中模型在有限数据集上进行多个时期的训练。我们沿着两个轴研究数据约束的预训练:正则化和缩放。对于正则化,我们研究了屏蔽输入正则化(MIR),这是随机屏蔽输入上的辅助下一个标记预测损失。 MIR 测试扩散语言模型的核心随机掩码是否可以在不改变架构或推理开销的情况下使自回归预训练受益。在 72M 到 1.4B 参数模型中,我们发现在强权重衰减之上添加 MIR 可以改善仅自回归强权重衰减模型的验证损失,下游增益为 1.4B。对于缩放,我们提出了 SoftQ,这是一种将模型大小和数据大小耦合起来的缩放法则,以捕获它们在重复数据下的相互作用。诸如 Chinchilla law 之类的经典替代方案使用附加形式来解耦这些术语,从而使它们在数据约束机制中被错误指定。我们发现 SoftQ 比这些替代方案更适合数据受限的实验,并且估计 MIR 的增益大约相当于唯一训练数据的 1.3 倍。我们在 https://github.com/yixinw-lab/dc_pretrain 发布了我们的代码。