论文
超越失败:能源感知 知识蒸馏 在代码相关任务上实现可持续 LLM
Beyond FLOPs: Energy-Aware Knowledge Distillation for Sustainable LLMs on Code-Related Task
摘要
背景:大语言模型(LLM)越来越多地应用于软件工程(SE)任务,在克隆检测、漏洞预测和代码摘要等问题上实现高精度。然而,它们的高计算需求和能源消耗引发了可持续性问题,并阻碍了它们在消费硬件和资源受限平台上的使用。在文献和行业中报告 LLM 计算成本的常见方法是使用通过网络执行传递所需的浮点运算 (FLOP) 数量。目标:本文研究了能量感知 知识蒸馏 对 SE 的影响,旨在在保持性能的同时提高模型效率,并确定 FLOP 是否是可靠的能量感知指标。方法:我们使用 Morph(一种基于多目标优化的 蒸馏 方法)进行了对照实验,以实证检验 FLOP 是否准确反映了克隆检测和漏洞预测任务中的能耗。我们扩展了这种方法,包括在优化过程中直接估计 CPU 和 GPU 能耗的能量替代模型,并且我们将 Morph 应用于使用 CodeT5+ 进行代码摘要的生成任务。结果:我们的结果表明,FLOP 并不总是可靠的能耗指标,通过使用能量替代模型可以获得更好的结果。经过精炼的学生模型可以将推理能耗降低高达 90%,将内存使用量降低 86%,而仅需要适度的精度权衡。结论:能源感知型 知识蒸馏 在直接能源替代而不是 FLOP 的指导下可以提高 SE 应用程序的 LLM 的能源消耗、可持续性和可部署性,从而在消费类硬件上实现高效模型。