论文
FairyFuse:通过融合三元内核对 CPU 进行无乘法 LLM 推理
FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels
摘要
大语言模型 越来越多地部署在仅 CPU 的平台上,其中内存带宽是自回归生成的主要瓶颈。将权重量化到四位或更低可以减少内存压力,但现有系统仍然对权重进行反量化并执行浮点乘法,从而限制了可实现的增益。 {-1, 0, +1} 中的三元权重提供了一种更有效的替代方案,用条件加法、减法或无操作代替乘法。虽然 Fairy2i 表明三进制 LLM 可以匹配 FP16 质量,但其运行时并未利用此结构。我们推出了 FairyFuse,这是一种推理系统,通过使用掩码加法和减法将每个宽线性层的 8 个实值子 GEMV 融合到单个 AVX-512 循环中,实现在商用 CPU 上的无乘法执行,并且具有零浮点乘法。 Roofline 分析表明,16 倍权重压缩将受内存限制的 GEMV 转向带宽有限的 CPU 上的计算模式,从而产生 29.6 倍的内核加速,同时对 GPU 几乎没有带来任何好处。 FairyFuse 在单个 Intel Xeon 8558P 上实现了每秒 32.4 个词元的端到端性能,性能比 llama.cpp Q4_K_M 高出 1.24 倍,且质量接近无损(WikiText-2 困惑度 5.52 与 5.47 FP16;下游准确度 66.0%)。