ITQ3_S:通过带有旋转域平滑的交错三元量化进行高保真 3 位 LLM 推理
ITQ3_S: High-Fidelity 3-bit LLM Inference via Interleaved Ternary Quantization with Rotation-Domain Smoothing
摘要
我们提出了 ITQ3_S(交错三元量化 - 专用),这是一种用于 LLM 的新型 3 位权重量化格式,集成了 TurboQuant (TQ),这是一种基于快速 Walsh-Hadamard 变换 (FWHT) 的旋转域策略。传统的 3 位方法因重尾权重分布和通道间异常值而遭受精度损失。 ITQ3_S 在量化之前通过 FWHT 预旋转权重空间,将离群能量分布在向量上,并产生适合均匀三元编码的近高斯分布。我们推导出严格的反量化过程,将 256 点逆 FWHT 融合到 CUDA 共享内存加载阶段,确保重建误差仅受三元量化网格限制,而不会因变换反转而产生额外误差。对于任何权重向量 $\mathbf{w} \in \mathbb{R}^{256}$,重建满足 $\|\hat{\mathbf{w}} - \mathbf{w}\|_2 \leq ε_q$,严格小于不利用旋转引起的分布归一化的均匀 3 位基线。 TurboQuant 缺乏原生 CUDA 内核,无法直接部署;使用现有权重量化器简单地组合 TQ 会引入跨层累积的域不匹配错误,从而使质量降低到标准 3 位基线以下。 ITQ3_S 通过将 FWHT 旋转和量化内核共同设计为基于 IQ3_S 权重格式的统一管道,并将逆变换融合到 CUDA MMQ 内核中来解决此问题。根据经验,在 NVIDIA RTX 5090 (Blackwell) 上,ITQ3_S 实现了与 FP16 竞争的困惑度,同时通过优化的 DP4A 和 Tensor Core 调度提供超过 4 位替代方案 1.5 倍的吞吐量。我们的结果表明 ITQ3_S 是一种实用的、基于数学的解决方案,适用于消费类硬件上的高保真 LLM 部署。