论文

用于 Wan2.2-I2V 的 W4A4 量化的时间步感知 SVDQuant-GPTQ

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

摘要

大视频扩散 Transformer 的 W4A4 量化可节省大量内存,但受到两个主要挑战的阻碍:稀疏的大幅激活异常值,以及跨多步去噪轨迹的强烈时间步相关的激活分布。 Wan2.2-I2V 的两位专家混合专家 DiT 设计加剧了这些困难,其高噪声和低噪声专家表现出独特的量化灵敏度,这是单一全局校准策略无法捕获的。我们提出了一种 后训练 量化框架,结合了基于 SVDQuant 的低秩异常值补偿、基于 GPTQ 的重构感知残差权重量化以及为每个专家独立进行的时间步长箱式每层激活裁剪比搜索。在 OpenS2V-Eval 基准测试中,我们的方法相对于 BF16 基线将峰值 GPU 内存减少了 59.3%,而 VBench 平均得分仅下降 0.9%,成像质量仅下降 2.3%,这表明专家和时间步感知校准对于 MoE 视频 DiT 上的高保真 W4A4 推理至关重要。