论文

通过幂律熵搜索有效估计最优超参数缩放定律

Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

模型训练预训练

摘要

最佳超参数缩放定律描述了 大语言模型 (LLM) 训练的最佳超参数如何随模型和数据规模而变化,使从业者能够预测生产规模的最佳配置,而无需昂贵的大规模调整。然而,估计这些缩放定律通常需要在数千次训练运行中进行详尽的网格搜索,消耗大量的计算资源。我们引入幂律熵搜索(PLES),这是一种基于多保真贝叶斯优化的计算成本感知采集函数,可通过自适应实验有效估计最佳超参数缩放定律。 PLES 的一个关键创新是它寻找能够降低标度律估计总体不确定性的候选函数,而不是优化单个目标函数。在每次迭代中,PLES 选择能够最大程度地降低每单位计算成本的缩放定律估计的不确定性的候选配置,自然有利于信息丰富的小规模实验。我们根据综合基准、适合真实 LLM 训练数据的代理模型以及实际 LLM 预训练 运行来评估 PLES。在所有设置中,PLES 收敛到准确的最佳超参数缩放定律,使用的计算预算不到传统网格搜索和其他基线所需计算预算的十分之一。