OSCAR:用于 2 位 KV 缓存量化的离线频谱协方差感知旋转
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
摘要
INT2 KV 缓存量化对于长上下文 LLM 服务很有吸引力,但要实现准确且可部署仍然很困难。简单的旋转(例如 Hadamard 变换)可以减少异常值,但在 INT2 时仍然会降级,因为它们与下游注意力不一致。我们提出了 OSCAR,一种超低位 KV 缓存量化方法,可以离线估计注意力感知协方差结构,并使用它们来导出用于量化的固定旋转和裁剪阈值。通过这种方式,它将 KV 量化与注意力实际消耗的协方差结构对齐。更重要的是,我们不仅提供理论依据,还开发了一个完全可部署的 OSCAR 系统,该系统具有自定义 INT2 注意力内核,该系统与分页 KV 缓存服务和融合内核管道保持兼容,从而能够无缝集成到现代 LLM 服务框架(例如 SGLang 和 vLLM)中。我们在最近的推理模型上评估了我们的方法,其中推理跟踪涉及 5 个任务中多达 32k 个标记。在 Qwen3-4B-Thinking-2507 和 Qwen3-8B 上,OSCAR 将 BF16 精度差距分别减小到 3.78 和 1.42 点,而朴素旋转 INT2 则崩溃到几乎为零。我们进一步将 OSCAR 扩展到 Qwen3-32B 和 GLM-4.7(358B 参数),它仍然有效地与 BF16 保持同等水平。在长期背景下 - RULER-NIAH 高达 128K,OSCAR 在两个 Qwen3 模型上保持稳健,而朴素旋转 INT2 崩溃。在系统方面,OSCAR 将 KV 缓存内存减少了约 8 倍,在相同内存预算下,大批量的吞吐量提高了高达 7 倍,并且由于内存带宽开销减少,与 BF16 相比,将批量大小 1 解码速度提高了 3 倍。