论文

SAW-INT4:用于实际 LLM 服务的系统感知 4 位 KV 缓存量化

SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving

模型推理KV Cache

摘要

KV 缓存内存是现实世界 LLM 服务的主要瓶颈,其中系统必须同时支持延迟敏感的小批量请求和高吞吐量并发工作负载。尽管许多 KV 缓存压缩方法提高了离线准确性或压缩率,但它们经常违反实际服务约束,例如分页内存布局、常规内存访问和融合注意力执行,从而限制了它们在部署中的有效性。在这项工作中,我们确定了在这些约束下仍然可行的最小 4 位 KV 缓存量化方法集。我们的主要发现是,一种简单的设计——带有块对角 Hadamard 旋转的 token-wise INT4 量化——始终能够实现最佳的精度与效率权衡。在多个模型和基准测试中,这种方法几乎恢复了朴素 INT4 损失的所有精度,而一旦考虑到服务兼容性,矢量量化和 Hessian 感知量化等更复杂的方法仅提供边际额外收益。为了实现这一点,我们实现了一个融合旋转量化内核,该内核直接集成到分页 KV 缓存布局中,并引入零可测量的端到端开销,在并发级别上与普通 INT4 吞吐量相匹配。我们的结果表明,有效的 KV 缓存压缩从根本上来说是一个系统协同设计问题:在实际服务约束下,轻量级块对角 Hadamard 旋转是一种可行的方法,可以在不牺牲服务效率的情况下提供近乎无损的精度。