论文
用于单 GPU LLM 推理的预算感知压缩管道:方法、权衡和耦合效应
Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects
摘要
在 NVIDIA GPU 上单 GPU 部署 70B 参数语言模型受到设备内存、长上下文吞吐量和工程集成成本的限制。我们将单 GPU 推理视为这三个轴上的预算感知设计问题,并研究修剪、量化和 KV 缓存压缩在实际执行下如何相互作用。受控消融表明,分层修剪使权重量化更加稳健。 KV 缓存稀疏化通过减少内存而不影响解码速度来补充 INT8 KV 量化,而静态矢量量化器通常与动态缓存发生冲突。在这些耦合结果和明确的预算跟踪的指导下,我们组装了一个实用的管道,并将 70B 模型压缩到约 33 GB,在单个 A40 上的 10k 词元提示上维持约 57 词元/秒,并在常见和推理基准上将绝对精度保持在 5% 以内。我们提供设计规则和可重复的评估协议,共同报告质量、内存和端到端速度,并为实际单 GPU 约束下的自动管道搜索提供基础。