论文

分解量化:专门化 LLM 预填充和解码

Disaggregated Quantization: Specializing LLM Prefill and Decode

摘要

预填充和解码奖励不同的量化方法:低精度算术加速即时处理,而紧凑的权重减少生成过程中的内存流量。我们提出“分解量化”(DQ),它专门针对这两个阶段的计算格式、权重和存储布局。在 Qwen 3 和 Gemma 3 上,专门在解码上删除激活量化可以提高解码繁重任务的准确性,而不会增加推理成本。相对于仅权重推理,训练单独的计算本机预填充权重可加速即时处理,同时在解码繁重和预填充繁重的任务上匹配或超过 2-3 位解码的准确性。使用已发布的 Qwen3.8-27B GGUF 解码器,训练 NVFP4 预填充器将 MMLU-Pro 上的 1 位精度提高了 32.5 个点,在 MMMU-Pro 上提高了 35.3 个点,而无需修改解码检查点。为了在单个设备上容纳额外的检查点,卸载的分类预填充 (ODP) 从 SSD 流式传输其权重,在提示长度内分摊加载。在相同的 27B 模型上,ODP 在该 http URL 中以 8K 提示长度提供比仅权重基线高 1.78 倍的首次词元时间加速。我们评估了 vLLM 中分解服务下的准确性,并通过对高达 2.8T 参数的模型进行训练后量化来进一步验证共享权重格式分解。