论文

CubicQuant:用于具有 1-8 位权重的高吞吐量 LLM 推理的参数化非均匀码本

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

摘要

大语言模型推理的权重量化必须平衡自适应重建级别与足够规则的表示,以实现高效的 GPU 执行。统一整数将每个组限制为线性网格。低位浮点格式使用固定的指数尾数结构,而学习的码本以不规则解码和额外元数据为代价获得灵活性。我们引入了 CubicQuant,一种参数化的非均匀标量格式,它保留密集的整数码流,同时适应每个权重组内的重建级别。由两个形状参数和一个比例指定的单调三次曲线将均匀间隔的幅度代码映射到非均匀级别。该系列涵盖 1-8 位权重有效负载,包含对称均匀整数量化作为精确的特殊情况,并且对于有效负载宽度 B 和组大小 G,每个权重具有有效宽度 B + 64/G 位。我们在均匀分布、高斯分布和拉普拉斯分布下导出总体失真,制定连续和动态 A8 载波感知拟合目标,并描述直接打包权重 GPU 执行。对于 G=128 的有限组,每个分布有 15,360 个样本,W4 CubicQuant 相对于最佳裁剪的四位均匀整数量化,在 Uniform 上将重建 RMSE 降低了 3.90%,在高斯样本上降低了 13.49%,在拉普拉斯样本上降低了 28.14%。相对于最佳列举的四位有限浮点格式,减少量分别为 3.90%、9.44% 和 6.27%。初步的 H200 内核测量显示了依赖于工作负载的交叉:对于窄 GEMV,模型数据类型执行速度更快,而随着行数的增加,动态 A8 变得更有利。结果确立了该格式的代表性承诺和直接可执行性;下游模型质量和跨设备端到端性能仍然是悬而未决的评估问题。