论文

IsoQuant:LLM KV 缓存压缩的硬件对齐 SO(4) 等斜旋转

IsoQuant: Hardware-Aligned SO(4) Isoclinic Rotations for LLM KV Cache Compression

摘要

正交特征去相关对于低位在线矢量量化是有效的,但密集随机正交变换会导致 $O(d^2)$ 存储和计算成本过高。 RotorQuant 通过块式 $3$D Clifford 转子降低了这一成本,但由此产生的 $3$D 分区与现代硬件的配合不佳,并且提供了有限的本地混合。我们提出 \textbf{IsoQuant},一个基于四元数代数和 $SO(4)$ 等斜分解的块式旋转框架。它将每个 $4$D 块表示为四元数,并应用闭合形式变换 $T(v)=q_L v \overline{q_R}$。这产生了两个主要变体:\emph{IsoQuant-Full},它实现了完整的 $SO(4)$ 旋转;和 \emph{IsoQuant-Fast},它只保留一个等斜因子以降低成本;该框架还允许轻量级的 $2$D 特殊情况。在 $d=128$ 时,IsoQuant-Full 将 RotorQuant 中的前向旋转成本从约 $2{,}408$ FMA 降低至 $1{,}024$,而 IsoQuant-Fast 进一步将其降低至 $512$。在 $18$ 融合 CUDA 设置、$d \in {128,256,512}$、位宽 ${2,3,4}$ 和 FP16/FP32 执行中,IsoQuant 比 RotorQuant 实现了约 $4.5\times$--$4.7\times$ 的平均内核级加速,同时保持可比的重建 MSE,峰值加速高于 $6\times$。当前验证仅限于合成归一化向量上的第一阶段量化-反量化路径;端到端的 KV 缓存评估仍然是未来的工作。