论文
Transformer 的能耗 微调:屋顶线启发的缩放模型
The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model
摘要
基于 Transformer 的模型支撑着现代自然语言处理,但会产生快速增长的计算和能源成本。随着模型大小和并行性的训练规模不断扩大,准确预测能耗对于可持续和具有成本意识的系统设计至关重要。我们提出了一个框架,用于对多个 GPU 上的 Transformer 训练的能耗进行建模。使用 BERT 模型的受控架构扫描,我们将测量的能量与计算、内存流量和硬件效率的轻量级代理相关联。受屋顶线模型的启发,我们的方法结合了基于加速的硬件效率因素,可以捕获张量并行性和完全分片数据并行性的影响。我们推导出一个标度律模型,可以准确预测跨异构配置的训练能量。