论文
用于 大语言模型 推理的快速 NF4 反量化内核
Fast NF4 Dequantization Kernels for Large Language Model Inference
摘要
大语言模型 (LLM) 的增长超出了单个 GPU 设备的内存容量,需要量化技术才能实际部署。虽然 NF4(4 位 NormalFloat)量化可减少 4倍的内存,但当前 NVIDIA GPU(例如 Ampere A100)上的推理需要昂贵的反量化回 FP16 格式,从而造成了关键的性能瓶颈。本文提出了一种轻量级共享内存优化,通过有原则的内存层次结构利用来解决这一差距,同时保持完整的生态系统兼容性。我们将我们的技术与开源 BitsAndBytes 实现进行比较,通过利用共享内存相对于全局内存访问的 12--15$\times$ 延迟优势,在三种模型(Gemma 27B、Qwen3 32B 和 Llama3.3 70B)中实现 2.0--2.2$\times$ 内核加速,并实现高达 1.54$\times$ 端到端改进。我们的优化通过简化的索引逻辑减少了指令数量,同时每个线程块仅使用 64 字节的共享内存,这表明轻量级优化可以通过最少的工程工作实现显着的性能提升。这项工作为 HuggingFace 生态系统提供了即插即用的解决方案,使现有 GPU 基础设施上的高级模型的访问民主化。