论文
LLM 推理中的压缩悖论:即时压缩的提供者相关能量效应
The Compression Paradox in LLM Inference: Provider-Dependent Energy Effects of Prompt Compression
摘要
大语言模型 的快速扩散造成了一个环境悖论:有助于解决气候挑战的技术本身却成为全球碳排放的重要贡献者。我们在三个提供商(OpenAI GPT-4o-mini、Anthropic Claude-3.5-Sonnet 和 DeepSeek-Chat)、五个基准(HumanEval、MBPP、GSM8K、MATH、MMLU)和四个压缩比(r in {1.0、0.7、0.5、 0.3})。能量是通过基于词元的代理来估计的,该代理根据本地直接测量进行校准,并通过基准通过率来跟踪质量。压缩产生了显着的质量损失(基线时的总体通过率为 26.0%,r=0.7 时的总体通过率为 1.5%),并且能源行为强烈依赖于提供商。 DeepSeek 在压缩下表现出输出扩展(r=0.3 时为 21 至 798 个词元),对应于能量增加高达 +2,140%,而 GPT-4o-mini 则表现出混合效应,包括 r=0.5 时的减少。这些结果表明,单独减少输入词元并不是生产推理中可靠的能量优化策略。对于评估的设置,模型选择和输出长度控制提供了比即时压缩更一致的能量质量权衡。