论文

PermuQuant:通过对扩散模型的通道重新排序来降低每组量化误差

PermuQuant: Lowering Per-Group Quantization Error by Reordering Channels for Diffusion Models

摘要

大型视觉生成模型取得了令人瞩目的表现。然而,它们的高计算和内存成本使得在资源受限的场景(例如交互式应用程序和个人单 GPU 使用)中的部署具有挑战性。 后训练 量化 (PTQ) 通过压缩预训练模型而无需昂贵的重新训练提供了实用的解决方案。然而,现有的 PTQ 方法在极低位设置下仍然存在严重的质量下降问题。在本文中,我们将通道排序视为每组量化中一个重要但尚未充分探索的因素。在此设置中,每个连续组共享一个量化比例。当统计数据差异很大的通道被放置在同一组中时,尺度可能会受到异常值的支配,并导致较大的量化误差。基于这一观察,我们提出了 PermuQuant,一种用于低位扩散模型的简单有效的 PTQ 框架。 PermuQuant 在每组量化之前通过联合二阶矩标准对通道进行排序,将具有相似激活和权重统计的通道放入同一组中。它还使用基于校准的接受规则,仅当所选排列减少校准数据的量化误差时才应用重新排序。选定的排列被吸收到相邻模块中或离线应用于权重,从而避免显式的运行时排列操作。对多个大型扩散模型的大量实验表明,PermuQuant 始终如一地降低了量化误差并优于现有的 PTQ 基线。在配备 RTX 5090 的 FLUX.1-dev 上,PermuQuant 在 W4A4 NVFP4 量化下实现了高达 1.7$\times$ 的单步加速,并将 DiT 内存占用减少了 3.5$\times$。代码可在 https://github.com/ysheng04/PermuQuant 获取。