论文

推导 OpenEuroLLM 模型的缩放定律:学习率、批量大小和损失

Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss

模型训练预训练

摘要

我们研究了在英语流行语料库上预训练密集 大语言模型 时学习率和批量大小的缩放行为。除了联合优化学习率和批量大小之外,我们还研究了模型容量和数据规模的边际演化,并开发了一个捕获这些关系的模型。当我们采用预热-稳定-衰减学习率计划时,我们进一步研究了在广泛的超参数设置、模型和数据预算上学习率退火的收益,以及最佳学习率和批量大小是否在稳定阶段和衰减阶段之间转移。最后,我们描述了损失对模型容量和数据集大小的依赖性,评估了最近提出的明确建模其交互的缩放形式。我们发现这些方法在我们的实验中特别有效地捕获训练不足和过度训练的情况。这项研究为未来 OpenEuroLLM 模型的开发建立了第一个基线和扩展程序。我们开源了本研究中使用的预训练运行的完整集合。