论文
显微镜下的梯度:内存高效梯度计算方法的资源利用基准测试
Gradient Under Microscope: Benchmarking Resource Utilization of Memory-Efficient Gradient Computation Methods
摘要
人工智能训练不断增加的资源强度正在给电力供应和碳预算带来压力,这促使人们对受限硬件上的内存高效训练进行系统研究。我们在四种 Transformer 架构(ViT、ModernBERT、Llama 3.1 1B 和 NanoVLM)的三种内存策略(标准训练、梯度检查点和梯度累积)下对五种梯度优化器(SGD、Adam、Adagrad、Adadelta 和共轭梯度下降)进行基准测试,测量训练损失、GPU 利用率、训练时间和内存使用情况。梯度累积成为最可靠的策略,在视觉语言模型上将训练损失减少了大约一个数量级,在没有额外 GPU 内存的情况下将语言模型上的训练损失减少了大约四倍。与通常的做法相反,Adam 并不普遍优越:Adadelta 和 SGD 在编码器和自回归架构上优于它。梯度检查点的效果强烈依赖于架构,改善了视觉 Transformer 损失,同时严重降低了编码器模型的性能,并且它使内存限制模型的训练时间增加了多达 60%。 GPU 利用率主要由架构决定,范围从内存限制型语言模型的 8-15% 到计算限制型视觉模型的 96-99%。这些发现为资源高效型 模型训练 和部署中的优化器和梯度策略选择提供了实用指南。