论文

ScheduleFree+:将无费率和无日程学习扩展到 大语言模型

ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models

模型训练预训练

摘要

无计划学习已显示出作为一种实用的随时机器学习训练方法的前景,在数十个标准基准问题上取得了成功。然而,LLM 训练的强大性能仅在小规模下得到证明。我们确定了将无计划学习扩展到更大批量大小和模型大小所需的许多修复方法,并提出了一种用于训练 大语言模型 的无学习率和无计划方法 (ScheduleFree+),该方法大大优于 Warmup-Stable-Decay (WSD) 计划。我们还证明无调度学习对于长时间训练最有效,并且在每个参数 1000 个词元的情况下,它的性能比 SOTA 调度高出 31%。无调度学习为预训练期间使用模型平均和检查点合并提供了理论基础。