论文

重播曲率:用于大语言模型推理的准确且可扩展的 NVFP4 量化

Replay the Curvature: Accurate and Scalable NVFP4 Quantization for Large Language Model Inference

摘要

大语言模型使权重存储和内存流量成为主要的推理成本,从而激发了仅用几个位表示每个权重的低精度格式。此类格式使用比例将浮​​点值映射到小码本中; NVFP4 通过让每 16 个 E2M1 权重共享一个 E4M3 块规模来提高本地范围利用率。在 GPTQ 中选择该比例很困难,因为量化一列会更新后面的列,因此独立评估块可能会错误估计其最终重建误差。大型模型带来了第二个挑战:全精度权重、校准激活和二阶状态不能全部保留在一个加速器上,而将完整的层分配给设备会使每个耗时的层求解串行。我们引入了 Schur Replay,一种尺度选择算法,它再现每个块尺度引起的 GPTQ 更新,并在考虑未量化列的补偿后对所得块误差进行评分。另外,我们的执行基础设施仅保留活动层驻留,跨设备、主机和磁盘进行层激活,导出后退出全精度层,并跨张量并行列分配独立的输出行。在 Qwen3.5-397B-A17B 和 Llama-3.3-70B-Instruct 上的七个基准测试中,算法和基础设施总共从 BF16 获得了 99.35\%$ 和 100.84\%$ 问题加权恢复。在 397B 型号上,该基础设施比 ModelOpt 减少了每层测量时间 15.17 美元,比 LLM 压缩机减少了 23.14 美元,并且每个 GPU 使用的内存更低。