用于 KV 缓存压缩的 Hurwitz 四元数乘法量化
Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression
摘要
我们提出了 Hurwitz 四元数乘法量化(HQMQ),这是一种用于 大语言模型 的 KV 缓存压缩的无校准方法。 HQMQ 将 K 或 V 的每个 4 元素块视为四元数,并将其单位方向量化为 \emph{product} $q_p \cdot q_s$,其中 $q_p$ 范围在 24 元素 Hurwitz 群 $2T$($S^3$ 上 24 单元的 24 个顶点,成对角度 $60^\circ$),$q_s$ 范围在$S$ \emph{random} 单位四元数的每(层,头)辅助码本。乘法组合在 $S$ 存储参数处产生 $24S$ 有效码字;随机初始化就足够了,因为左乘是 $S^3$ 等距,因此种子码本在最终任务 ppl 中变化 $<1.5\%$。每批次中值乘数离群值提取步骤($C{=}3$,无校准)可处理现代离群值较多的架构。我们评估了五种现代开放模型:Mistral-7B(密集 MHA)、Llama-3-8B 和 Qwen2.5-7B 和 Qwen3-8B(密集 GQA)以及 gpt-oss-20b(稀疏 MoE)。在 Mistral-7B 和 Qwen3-8B 上,HQMQ 在 $0.02$--$0.03$ ppl 点的 $\sim$5 位内匹配 fp16。在 Qwen2.5-7B 和 Qwen3-8B 上,朴素 int4 崩溃到 $10^4{+}$ ppl,HQMQ + Med3$\times$ 在 $0.02$--$0.10$ ppl 点内恢复 fp16 质量 $\sim$5 位。 HQMQ Pareto 在所有五个模型的匹配位上以 $3$--$1900\times$ 主导朴素 int,并且下游零样本精度在 Mistral 上以 $3.79$ 位匹配 fp16。相对于最强的校准 KV 量化基线,$3.79$ 位的 HQMQ 与 KIVI-4($\sim 4.5$ 位)相匹配,在 CoQA 上 ${\sim}1$ 点,在 TruthfulQA 上 $0.6$ 点,在 GSM8K 上 $2.3$ 点,比特数少 $16\%$,并且没有校准通道。在存储级别,HQMQ 提供高达 5.05\times$ KV 压缩,将 Llama-3-70B 128k 上下文缓存从 43 GB 缩小到 8.5 GB。