FASQ:用于免校准的灵活加速子空间量化 LLM 压缩
FASQ: Flexible Accelerated Subspace Quantization for Calibration-Free LLM Compression
摘要
压缩 大语言模型 (LLM) 以部署在商用 GPU 上仍然具有挑战性:传统的标量量化仅限于固定位宽(例如 8/4/3 位),仅提供几个离散压缩点,并且通常需要校准数据。我们提出了 FASQ(灵活加速子空间量化),这是一种免校准框架,可将乘积量化应用于 LLM 权重矩阵。通过调整子向量大小和码本基数这两个参数,FASQ 公开了跨越原始 FP16 模型大小 27-49% 的连续设计空间,填补了固定位方案无法达到的压缩间隙。在 Meta-Llama-3-8B 上,FASQ 在模型大小为 37-42% 时的准确率(平均 67.1-67.7)超过了 4 位 GPTQ 和 AWQ,并且在 Qwen3-8B 和 Qwen3.5-9B-Base 上的结果一致。为了使乘积量化在推理时变得实用,我们设计了自定义 CUDA 内核:用于解码的无 LUT 直接计算 GEMV 和用于预填充的输出固定双缓冲 LUT GEMM,两者都具有 split-K 并行性。在 RTX~3090 上,FASQ 在有效 4 位(内存减少 2.56 倍)下实现 45.2 tok/s 解码,在有效 3 位(2.80 倍)下实现 51.8 tok/s 解码,均超过 FP16 张量核心性能(43.9 tok/s),并提供 AWQ 吞吐量的 1.6 至 1.8 倍、AWQ 的 2.5 至 2.5 倍。 GPTQ 和 RTN 的 4.3 至 5 倍。 FASQ 是唯一一种加速解码速度超过 FP16 的压缩方法,提供免校准压缩、连续的大小质量权衡以及在单个消费级 GPU 上的实时推理。