论文
缩小 Hessian:多模态扩散Transformer的 4 阶 W4A4 量化
Deflating the Hessian: Rank-4 W4A4 Quantization for Multimodal Diffusion Transformers
摘要
在扩散Transformer中,低秩分支可以通过将每个权重分解为低位残差和高精度低秩分量来减轻 4 位权重激活 (W4A4) 训练后量化 (PTQ) 损失。然而,现有的低秩 PTQ 方法要么分别优化低秩补偿和残差量化,通常需要更高的秩,要么依赖二阶权重更新,而不明确建模激活量化误差,这在 4 位量化下变得特别明显。为了解决这些限制,我们提出了 \method{},一个统一的框架,将低秩辅助 W4A4 PTQ 建模为耦合校准问题,并从联合目标中导出基于优化的求解器。消除输出侧低秩因子会产生 \emph{deflated Hessian},它会折扣低秩分量已经捕获的残余误差,同时合并激活噪声替代项以抑制激活量化误差。在五个扩散主干中,4 级\方法{}在 PSNR 和 LPIPS 方面始终优于 4 级 SVDQuant。它 在 SANA-1.6B、FLUX.1-schnell 和 FLUX.1-dev 上进一步超越了排名 32 的 SVDQuant,排名小了 8 倍,量化速度快了 6.25 倍。此外,在 Qwen3-8B LLM 上,相对于 32 级 SVDQuant,4 级 \method{} 将 MMLU 准确度从 61.50\% 提高到 68.17\%。总体而言,\method{} 实现了更好的 W4A4 性能,同时显着降低了排名和量化成本。