论文
PolarQuant:通过 Hadamard 旋转进行 LLM 压缩的最佳高斯权重量化
PolarQuant: Optimal Gaussian Weight Quantization via Hadamard Rotation for LLM Compression
摘要
我们提出了 PolarQuant,一种针对 大语言模型 (LLM) 的 后训练 权重量化方法,它利用神经网络权重的分布结构来实现近乎无损的压缩。 PolarQuant 分三个阶段运行:(1) 对单位超球面进行块式归一化,(2) Walsh-Hadamard 旋转将坐标转换为近似高斯随机变量,以及 (3) 质心与高斯分布匹配的量化。我们的消融表明,Hadamard 旋转本身就占质量改进的 98%,将 Qwen3.5-9B 困惑度从 6.90 (absmax Q5) 降低到 6.40(Delta = +0.03 from FP16),使其在没有任何校准数据的情况下几乎无损。此外,PolarQuant 还可以作为下游 INT4 量化器的有效预处理步骤:由 torchao INT4 去量化和重新量化的 PolarQuant Q5 的困惑度为 6.56,而直接 absmax INT4 的困惑度为 6.68,同时在 6.5 GB VRAM 下保持 43.1 tok/s 的吞吐量。代码和模型是公开的。