论文

DSAQuant:用于视频生成的去噪阶段对齐量化感知训练

DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation

摘要

视频扩散模型(VDM)在文本到视频生成方面取得了令人瞩目的进展,但其高内存和计算成本阻碍了实际部署。量化感知训练 (QAT) 是压缩和加速高级生成模型的有效解决方案,无需推理时的运行时开销。然而,现有的 QAT 方法在 VDM 中面临着一个独特的挑战:虽然它们通常保留提示语义、全局布局和粗略运动,但量化模型严重降低了视觉细节、纹理保真度和清晰度。在本文中,我们将这种退化追溯到传统量化管道的时间步长不可知设计,该设计忽略了视频降噪的分阶段功能。在VDM中,早期的去噪步骤主要建立全局结构和运动,而中后期的步骤则细化局部外观和高频细节。基于这一见解,我们提出了 DSAQuant,一种用于 VDM 的去噪阶段对齐量化感知训练框架。在训练过程中,面向去噪阶段的监督在早期步骤中保留教师 蒸馏 以实现稳定的结构规划,同时将后期步骤转向目标驱动优化以增强细节重建。在推理过程中,去噪阶段门控指导会在最终去噪步骤中禁用 CFG,以防止其将量化引起的误差放大为高频伪影。在 W4A4 和 W3A3 设置下对 Wan 和 CogVideoX 系列进行的大量实验表明,DSAQuant 始终优于 SOTA QAT 基线,在激进的 W3A3 量化下将 VBench 平均得分提高了 6.60,同时保持了强大的文本视频对齐。这些结果表明,有效的 VDM 量化不仅需要减少量化误差,还需要将量化训练和推理与视频扩散的阶段性性质保持一致。