论文

展开 Leech 晶格:2 位 LLM 权重的融合多壳解码和 VRAM 布局

Unfolding the Leech Lattice: Fused Multi-Shell Decoding and VRAM Layouts for 2-Bit LLM Weights

摘要

Leech-lattice 矢量量化在其自己的评估协议下拥有最强的报告 2 位质量。它的内核解码一个shell;我们发现没有实现该速率所需的多外壳解码器。本文提供了一个并测量了其在第 1 批解码阶段 GEMV 的服务成本。首先,完整 3​​01 类码本的服务路径:离线扩展到 GPU 布局和融合的 dequantize-plus-matvec 内核,在没有扭曲发散的情况下读取它们,并针对 f64 进行了验证。其次,VRAM 内速率是与磁盘上速率不同的设计轴。在一个进程中计时的四个位精确布局显示,二进制位平面在恒定带宽(每权重 4.80 位,2.15x FP16)下的大小和速度上击败了 one-hot 掩模。每秒4.3位以下,不规则流进入;在 3.6 处,解码不再是移位和掩码。第三,部署的四位 (AWQ) 和两位 (QTIP) GEMV 内核在同一进程中运行。网格内核读取的字节数比我们提供的布局少 2.40 倍,并且在字节边界的几乎相等分数下运行速度快 2.27 倍:时间间隙跟踪流量间隙,以及展开对于查找表来说太大的码本的成本。第四,有效性包络线:网格内核超出了我们的无权重控制范围,因此我们的发射几何结构设置了该下限,并且在第二个内存层次结构上,每个网格臂都低于 FP16。当输出头跨臂保持相同时,内核和格式路径在 4B、8B 和 14B 处端到端增益为 1.11x、1.29x 和 1.41x;使用 int8 输出头,所服务的 4B 在 2.60 GB 中达到 87.0 tok/s。质量成本、1.38 倍的困惑度和 14.7 MMLU 点在 4B 上,在测量的三个尺寸中有所缩小。