论文
用于语言模型低开销量化的结构化变换
Structured Transforms for Low-Overhead Quantization of Language Models
摘要
我们重新审视了 大语言模型 基于 Kashin 分解的权重量化,并提出了一种具有更强收敛特性和结构化、高效正交变换的改进算法。该方法将每个权重的核心分解为两个分量,一个具有有界无穷范数,另一个在正交变换后具有有界无穷范数,但用符号随机离散余弦变换 (DCT) 替换密集随机正交矩阵,从而将每次迭代成本从 $\mathcal{O}(N^2)$ 降低到 $\mathcal{O}(N \log N)$。所提出的具有交替更新的贪心算法保证了每个因子的稳定 2 位聚类所需的四峰分布,并允许聚类中心的封闭形式初始化,消除了先前工作的多次重启 k 均值瓶颈。由 OPTQ 式顺序误差补偿和 QuIP 式不相干预处理组成,生成的 JAX 管道与 OPTQ、QuIP、QuIP-RG 以及 QuIP# 的 微调 和无矢量量化变体在 OPT、Llama-2 和 Pythia 上每通道 4 位具有竞争力,并具有良好的挂钟缩放。有界$\ell_\infty$ 分解也非常稳健:在 QuIP 变体发散至四位数困惑度 (Pythia-6.9B) 或 LDL 反向替换中 NaN 中止 (Mistral-7B) 的压力配置上,Kashin-DCT 保持数值稳定并保持接近 FP16 基线。在推理时,每个权重分解为每个通道的两个 2 位因子代码,这些代码在结构上适合本机 2 位硬件。