SharQ:为 LLM 推理桥接激活稀疏性和 FP4 量化
SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference
摘要
现代加速器越来越支持低位浮点格式和半结构化稀疏性,但将它们组合起来进行 LLM 激活压缩仍然具有挑战性:激活包含在 FP4 量化中主导块尺度的输入相关异常值,直接应用 N:M 稀疏性掩模会丢弃中等值,将稀疏性损失与量化误差耦合起来。我们介绍 SharQ,这是一种 无需训练 推理方法,通过在线稀疏-密集分解将激活稀疏性和 FP4 量化联系起来。对于每个激活张量,SharQ 生成一个输入自适应 N:M 掩码来提取异常值主导的稀疏主干,将其量化为 FP4,并定义相对于量化稀疏主干而不是未量化稀疏值的密集残差。稀疏 FP4 GEMM 处理主干,而密集 FP4 GEMM 补偿掩模引起的激活损失和稀疏路径量化误差。两条路径共享具有特定于路径的比例视图的单个 FP4 权重有效负载,并且融合的准备内核将掩模生成、残差构建和层归一化吸收到一个算子中。 SharQ 不需要校准数据、重新训练或特定于模型的调整。在 Llama-3.1-8B、Qwen2.5-7B、Qwen3-30B-A3B 和 Qwen3-VL-8B 上进行评估,SharQ 在语言和视觉语言任务中恢复了 NVFP4 到 FP16 准确度差距的 43--63%,并在 NVFP4、HiF4 和 MXFP4 格式上进行了泛化。在 RTX 5090 上,SharQ 在语言模型服务方面比 FP16 延迟减少了 2.2--2.4$\times,吞吐量比 FP8 提高了 1.2--1.4$\times,与 SageAttention 结合使用时,Wan2.2-T2V-A14B 视频生成速度提高了 1.58$\times$。我们的代码可在 https://github.com/actypedef/SharQ 获取。