论文

QAM-W:通过 Hadamard 旋转和激活感知缩放对 LLM 权重进行联合 2D 码本量化

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

摘要

标量 后训练 量化器丢弃权重行内的成对坐标结构。我们引入了 QAM-W(权重正交幅度调制),这是一种恢复这种结构的编解码器:每行都经过 L2 归一化、块哈达玛旋转、配对成 2D 坐标,并针对在单位圆高斯上训练的单个 Lloyd-Max 码本进行量化,并具有激活感知的每通道缩放。在一项涵盖来自四个系列(1.1B--13B 参数)和八个量化配置的五个 LLM 的跨模型研究中,$\approx\%$ bpw 的激活感知变体在每个模型上保持在 BF16 WikiText-2 困惑度的 $\pm 0.4\%$ 范围内,与 SmoothQuant W8A8 质量包络相匹配,权重位少 $32\%$。在相同比特率下,联合 2D 编码的性能优于极坐标(幅度 $\times$ 相位)编码 2--15~pp $Δ$PPL,并且配对 KL 与 BF16 在 Spearman $ρ= 0.99$ 处跟踪 $Δ$PPL\%,跨越 37 行(方法、模型),与从编解码器失真到 KL 发散的单调复合界限一致。 3.5~bpw 变体在量化容忍架构上具有竞争力。在严格的 4~bpw 下,旋转码本前沿方法 QTIP 优于 QAM-W;贡献是保质的 5--6~bpw 频段。