论文

GRASS:基于梯度的自适应逐层采样降低大模型微调显存

GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning

模型训练参数高效训练

摘要

大语言模型 的全参数 微调 受到大量 GPU 内存需求的限制。低秩适配方法通过仅更新参数子集来缓解这一挑战。然而,这些方法通常会限制模型的表达能力,并且产生的性能低于全参数 微调。逐层微调 方法已作为替代方案出现,通过静态层重要性采样策略实现内存高效训练。然而,这些方法忽略了跨任务和训练阶段的层重要性的变化,导致下游任务的性能不佳。为了解决这些限制,我们提出了 GRASS,一种基于梯度的自适应逐层重要性采样框架。 GRASS 利用平均梯度范数作为任务感知和训练阶段感知指标来估计层重要性。此外,GRASS 通过自适应训练策略自适应调整层采样概率。我们还引入了一种逐层优化器状态卸载机制,该机制重叠计算和通信,以进一步减少内存使用,同时保持可比的训练吞吐量。跨多个模型和基准的大量实验表明,GRASS 始终优于最先进的方法,平均精度提高高达 4.38 点,内存使用量减少高达 19.97%。