论文

在数据受限的预训练中选择跨模型规模的重复计数

Selecting Repetition Counts Across Model Scales in Data-Constrained Pretraining

模型训练预训练

摘要

最适合小型语言模型的重复计数可能不会在更大范围内保持最佳状态。我们在预训练中研究了这种效应,使用有限目标语料库与固定目标分数的通用数据混合。在维基百科衍生的数据和 Proof-Pile-2 上,测量的重复计数的排名随着模型大小的变化而变化,520M Proof-Pile-2 实验证实,将重复从 16 个减少到 8 个可以改善损失,同时使用更少的训练token。我们使用几个较小模型的损失曲线来保留有希望的重复计数的简短列表,以进行更大规模的评估。在 PubMed 和 Caselaw 上,在目标模型训练之前固定的候选集在 200M 和 520M 的原始评估网格上保留了最低损失测量计数。这支持候选保留作为精确点预测的实用替代方案。我们还将剪枝回归与具有两个相反的重复相关损失项的经验缩放模型联系起来。对数模型大小的一阶扩展产生选择规则使用的线性形式,提供候选选择过程的基于缩放的解释。