论文
不要丢弃Dropout:为高效大语言模型训练与推理优化层稀疏性
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
摘要
层丢失(又称随机深度)已被证明可以在语言和视觉转换器中实现更快的训练、更高的准确性和对零样本层修剪的鲁棒性。然而,随着模型和数据集的扩展,dropout——尤其是层 dropout——已经从大型语言模型 (LLM) 预训练方法中基本上消失了。虽然之前的一些研究报告称,dropout 会降低准确性,但还没有全面的研究量化这种影响,更不用说减轻这种影响了。在这项研究中,我们表明层退出应该用于最先进的大语言模型培训,为培训和培训后的效益建立最佳实践和规模分析。具体来说,通过最佳层分布、时间安排和优化器超参数,我们观察到在相同的训练 FLOP 下,层丢失会导致较低的损失。对于给定数量的训练步骤,LLM 可以实现较低或相似的验证损失,同时节省高达 25% 的训练失败次数。此外,层丢失可以实现显着的训练后优化,例如提前退出、中间层跳过和自推测解码,从而产生高达 1.5 倍的推理加速,而精度损失可以忽略不计。通过超过 2400 个训练实验,涵盖从 271M 到 8.2B 参数的模型和高达 160B 标记的数据集,我们证明这些发现可以可靠地扩展到大规模训练体系。所有预训练实验均在 Cerebras CS-3 系统上运行。
