论文

更多GPU还是更小缓存?张量并行与KV压缩在内存受限LLM服务中的对比

More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving

AI 基础设施推理服务

摘要

当LLM服务的部署耗尽KV缓存空间时,有两条成熟的出路。张量并行将权重和KV缓存分片到两、四或八个设备上,以每层一次all-reduce和随设备数增长的硬件账单为代价换取内存余量。算法社区则就地缩小缓存,用KV量化和逐出保留单张GPU,付出少量质量代价。压缩论文报告内存比率,并行扩展论文报告吞吐曲线,几乎没有人把两者放到同一个成本轴上。我们将张量并行配置(并行度1到8)和KV压缩配置(16/8/4位,保留率低至0.25)放在一个成本归一化轴上——每百万token成本对延迟——使用在A100、A40和H100硬件上校准的剖析模拟器,并去寻找成本等价的交叉点。我们没有找到。跨越两个模型(7B和70B的Llama-2)、三种GPU类型以及我们所能构造的每一级内存缓解,压缩都便宜1.20倍到2.00倍。80 GB设备上的7B模型无法在其自身上下文窗口内耗尽KV预算,而决定两种策略取舍的边界是模型规模相对设备内存,对80 GB卡约为36B参数。在这道墙之下,压缩占优,额外的GPU大体是浪费的开支;在墙之上,张量并行不再是一种选择而成为入场券:Llama-2-70B在任何KV设置下都无法在单张A100上运行,因为约束资源是权重,而KV压缩不触及权重。张量并行是唯一能改善延迟的杠杆(压缩通过批处理争用使每token延迟恶化8%到93%),而压缩是唯一能成倍提高每美元容量的杠杆(16.5倍,对比八倍GPU开支的1.21倍)。

更多GPU还是更小缓存?张量并行与KV压缩在内存受限LLM服务中的对比:论文配图
图1:研究概览。(1) 受显存限制的服务部署可以增加GPU(张量并行:切分权重与KV显存,但引入all-reduce通信并成倍增加成本),或压缩KV缓存(量化与驱逐:保留单GPU,但牺牲质量并付出反量化开销)。(2) 两类方案见于各自独立的文献,衡量坐标不同,实践者无从判断哪种更便宜。(3) 我们将两者置于同一条成本归一化前沿(每百万token成本对比延迟)上,固定模型、质量下限与延迟目标,并搜寻成本等价交叉点。