论文

SoloQ:扩散语言模型的免校准量化

SoloQ: Calibration-Free Quantization for Diffusion Language Models

摘要

扩散大语言模型(dLLM)通过双向扩散生成词元,成为自回归模型的潜在替代方案。然而,模型规模与推理成本使部署困难:全序列去噪重复执行高成本前向计算,块扩散还引入内存密集的KV缓存。低位权重与激活量化因而具有吸引力,但现有训练后量化依赖校准数据,而激活分布会随遮罩状态和去噪步骤变化。我们提出免校准框架SoloQ,将权重和激活映射到边缘分布可预测的归一化旋转基,实现不依赖数据的量化。它结合结构化K-RPBH旋转与轻量缩放修正,旋转后分布可同时支持匹配码本和硬件原生NVFP4。对于块扩散,在提交时量化KV缓存,压缩持久状态而不扰动正在去噪的块。在LLaDA、Dream等全序列模型和Fast-dLLM v2、Nemotron-Labs-Diffusion等块模型上,SoloQ保留4位量化准确率,在知识和推理基准优于有校准基线。NVFP4下峰值内存最多缩减2.61倍,端到端推理最多加速2.24倍。

SoloQ:扩散语言模型的免校准量化:论文原图
图 2:SoloQ 概述。 (a) K-RPBH 结合了置换、块哈达玛和跨块混合,将异构表示转换为可预测的空间。 (b) SoloQ-C 和 SoloQ-N 分别使用分布匹配码本和 NVFP4 实现免校准权重激活量化。 (c) 对于块扩散模型,SoloQ 应用提交时 KV 量化,将去噪块保持在全精度 中。