论文
具有最佳批量大小计划的联合缩放法则
Towards joint scaling laws with optimal batch size schedules
摘要
现代深度学习通常在整个训练过程中保持批量大小静态,从而忽略了学习率和批量大小对训练动态的联合影响。在本文中,我们通过凸优化的视角研究了深度学习动态,并得出了两个时间表的损失联合表征,适用于通用优化器和模型架构。这种表征为任何规定的学习率计划生成了封闭形式的最佳批量大小计划,并进一步导致了始终优于静态批量大小基线的联合缩放法则,突出了动态批量大小计划在 大语言模型 训练中的重要性。