HyperQuant:适用于大型语言和扩散模型的速率失真优化量化管道
HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models
摘要
我们提出了 HyperQuant(Hadamard、optimally Packing、Entropy Rice-coding),这是一个统一的 后训练 量化管道,用于大型语言和扩散 Transformer 的权重和 KV 缓存。在一系列独立的实验中(表 1),HyperQuant 在权重上从 3 到 5 位每标量 (bps) 的每个操作点上都优于最新的 HIGGS 方案,并且在 KV 量化低至 1.7 bps 上击败了 TurboQuant 和 OCTOPUS。除了 LLM 设置之外,HyperQuant 还可以量化 19B 参数 LTX-2 DiT 视频模型,且没有可观察到的每帧伪影。在 H100 上以 4 bps 进行端到端时,HyperQuant 以近乎无损的质量将线性权重压缩约 3.9 倍,将 KV 缓存压缩约 3.79 倍。 HyperQuant 将四种已知的想法结合到一个结构中:(i)每图块随机哈达玛变换,使权重和激活的每坐标分布近似高斯分布; (ii) 量化为低维最优晶格(E8、D4、A2 或 Z); (iii) 点阵索引的无损位剥离和近熵最优可变长度莱斯编码; (iv) KV 缓存的偏差校正方法,使重建在内积下保持无偏差,保留注意力语义。我们进一步将管道与 8 位和 4 位 Tensor-Core MMA 路径(fp8-e4m3、int8、nvfp4、mxfp4)集成,并发现 int8 在 RHT 后晶格输出上优于 fp8。项目页面:https://moonmath.ai/hyperquant/