论文
迈向资源高效型 LLM:蒸馏 管道的端到端能源核算
Towards Resource-Efficient LLMs: End-to-End Energy Accounting of Distillation Pipelines
摘要
大语言模型 部署的增加推动了 GPU 需求和数据中心扩展的激增,引发了人们对电力使用、电网压力以及现代人工智能工作负载影响的担忧。 蒸馏 通常被宣传为获得更便宜、更高效模型的最有效途径之一,但这些说法很少考虑到完整的端到端能源和资源成本,包括关键的教师端工作负载,例如数据生成、logits 缓存和评估。我们提出了一个全面的能源核算框架,通过对 GPU 设备功耗的详细分阶段跟踪来测量 蒸馏 管道的完整计算成本。在我们的实验中,我们分离并记录了不同阶段的经验能源使用情况,并系统地测量了两种常见的 蒸馏 方法的能源和排放:基于经典 logits 的 知识蒸馏 和合成数据监督的 微调,构建了能源质量帕累托前沿,揭示了之前忽略的成本。从这些测量和分析中,我们得出了在能源和预算约束下选择 蒸馏 方法和超参数的实用设计规则,并发布了开源测量工具和会计协议,为可比较、可重复的 蒸馏 研究提供标准化基础,明确负责完整的管道能源影响。