论文
统一的神经尺度法则
Unified Neural Scaling Laws
摘要
我们提出了一种函数形式(我们称为统一神经缩放法则(UNSL)),它可以针对各种架构以及一组不同的上游和下游任务中的每个不同任务,准确地建模和推断深度神经网络的缩放行为,因为多个维度同时变化(即,当同时改变模型参数数量、训练数据集大小、训练步骤数量、推理步骤数量、计算量和各种超参数时,感兴趣的评估指标如何变化)。该套件包括大规模视觉、语言、数学和强化学习。与神经缩放的其他函数形式相比,这种函数形式产生的缩放行为的外推在该集合上要准确得多。