论文

DiRotQ:4 位扩散的旋转感知量化 Transformer

DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

摘要

Diffusion Transformer (DiTs) 实现了最先进的图像生成质量,但在推理时会产生大量的内存和计算成本。虽然达到 4 位精度的激进 后训练 量化 (PTQ) 可显着提高效率,但通常会导致严重的质量下降。现有的方法,包括基于平滑的方法、混合精度方案、旋转技术和低秩残差方法,部分缓解了这个问题,但与 FP16/BF16 性能仍然存在明显差距。在这项工作中,我们引入了 DiRotQ,这是一个 W4A4 PTQ 框架,它通过旋转感知激活量化来减轻这种退化。 DiRotQ 通过主成分分析 (PCA) 识别捕获主导激活方差的低秩子空间,以更高的精度保留该子空间中的系数,同时将其余分量量化为 4 位。使用校准导出的正交变换在推理时将激活旋转到 PCA 基础,而逆旋转则离线融合到层权重中。结合基于 GPTQ 的权重量化,DiRotQ 在 MJHQ-30K 数据集上的 PixArt-Σ 上实现了 15.9 的 FID(越低越好)和 19.1 dB 的 PSNR(越高越好),在相同的 INT W4A4 设置下优于先前最先进的 SVDQuant(FID 18.9,PSNR 17.6)。除了标准指标之外,我们还引入了用于扩散模型量化的 VLM-as-a-Judge 评估协议,这是此设置中的第一个此类评估,提供了对感知质量的更全面的评估,并在积极压缩下迅速对齐。在系统方面,我们实现了基于 Triton 的自定义内核,以实现高效的端到端推理,在 24 GB RTX 4090 GPU 上将 12B FLUX.1-dev 模型的内存使用量减少了 2.1 倍,并在 BF16 基线上提供了 2.3 倍的加速。