论文

不要丢弃Dropout:为高效大语言模型训练与推理优化层稀疏性

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

模型训练预训练

摘要

层丢失(又称随机深度)已被证明可以在语言和视觉转换器中实现更快的训练、更高的准确性和对零样本层修剪的鲁棒性。然而,随着模型和数据集的扩展,dropout——尤其是层 dropout——已经从大型语言模型 (LLM) 预训练方法中基本上消失了。虽然之前的一些研究报告称,dropout 会降低准确性,但还没有全面的研究量化这种影响,更不用说减轻这种影响了。在这项研究中,我们表明层退出应该用于最先进的大语言模型培训,为培训和培训后的效益建立最佳实践和规模分析。具体来说,通过最佳层分布、时间安排和优化器超参数,我们观察到在相同的训练 FLOP 下,层丢失会导致较低的损失。对于给定数量的训练步骤,LLM 可以实现较低或相似的验证损失,同时节省高达 25% 的训练失败次数。此外,层丢失可以实现显着的训练后优化,例如提前退出、中间层跳过和自推测解码,从而产生高达 1.5 倍的推理加速,而精度损失可以忽略不计。通过超过 2400 个训练实验,涵盖从 271M 到 8.2B 参数的模型和高达 160B 标记的数据集,我们证明这些发现可以可靠地扩展到大规模训练体系。所有预训练实验均在 Cerebras CS-3 系统上运行。

不要丢弃Dropout:为高效大语言模型训练与推理优化层稀疏性:论文配图
图 1:层 dropout 作为高效 LLM 训练和推理的统一机制。 (左)层丢失在预训练期间随机跳过层,从而加快训练速度,并且使用我们提出的配置,可以在不牺牲验证损失的情况下实现这一点。 (中)经过训练的模型获得零样本“弹性深度”,在早期退出和跳层情况下优雅地退化。 (右)这种鲁棒性延续到训练后适配器和自推测解码中,以实现无损推理加速。