论文

我们可以优化性能-碳排放盈亏平衡点吗?:追求绿色 LLM

Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

模型训练监督微调与指令调优

摘要

任何部署的 大语言模型 (LLM) 的碳足迹都会在推理过程中累积,其中模型的重复使用大大超过了 微调 的一次性成本。然而,大多数效率干预措施要么针对 预训练 规模,要么针对事后压缩。我们询问将经过校准的可微分能量替代项折叠到 微调 目标中是否可以产生推理行为,从而以零或接近零的碳成本获得任务准确性,这是一种收支平衡的配置。我们提出了一种联合损失机制,其中包含每个模型的碳排放参数、参数范数的线性代理、FLOP 代理和内存代理,适合硬件能量分析。我们微调了三个架构上不同的系列:Gemma-2 2B、Llama-3.1 8B 和 Qwen-2.5 14B,并评估三个 MMLU 科目的推理 F1 和 CO$_2$ 排放:抽象代数、哲学和形式逻辑。我们从几个结果中发现,根据任务结构,碳项要么表现为有害的干扰,要么表现为有益的正则化。我们将校准后的碳感知 微调 定位为轻量级、嵌入式正则化器,具有非空但依赖于模型和任务的盈亏平衡区域。这是一项正在进行的工作,我们将很快发布我们的代码库。