论文

StagQ:LLM的约束驱动多精度权重量化

StagQ: Constraint-Driven Multi-Precision Weight Quantization for LLMs

摘要

在一组部署中为大语言模型 (LLM) 提供服务需要多个重量为精度的操作点。多精度格式从一个流(其前缀是有效的较低精度代码)为它们提供所有服务,而不是存储多个副本。我们提出了 StagQ,一种多精度权重格式,其主流是 2 位分组仿射基,后跟二元步骤计划上可配置数量的 1 位细化平面。每个受支持的精度都是一个可读前缀,通过从所有精度共享的元数据派生的仿射映射进行解码,无需按权重查找。在网格安装之前和之后填充的稀疏辅助记录保留了网格最差的几个权重。我们报告了编码器的两种配置。在两位上,较便宜的一个在 Llama-3.1-8B、Phi-4 和 OLMo-2-7B 上领先最强的多精度基线 3.1 至 7.0 MMLU 点,逻辑速率略低。在三位上,它在 Llama-3.1-8B 上领先,在 Phi-4 上以更高的速度领先,在 OLMo-2-7B 上领先。在四位时,它以更高的速率连接到所有三个位。在 NVIDIA A100 GPU 上的批量一矩阵向量乘积中,根据合成权重计时,在大多数形状精度情况下,我们的内核比两个基线内核更快。