论文

用于大规模文本到视频扩散的边界保护 W8A8 HiFloat8 量化 Transformer

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

摘要

我们提出了适用于 Wan2.1-T2V-14B 的 后训练 量化 (PTQ) 方法,Wan2.1-T2V-14B 是一个 140 亿参数的文本到视频扩散 Transformer,针对 Ascend 910B NPU 上的 W8A8 HiFloat8 (HiF8) 格式。量化视频 DiT 模型的一个核心挑战是 Transformer 块之间的异构激活分布:边界块(第一个和最后几个块)表现出与中间块根本不同的统计特性,使得均匀量化无效。我们对所有 40 个 WanAttentionBlocks 进行了系统的每块激活分析,并利用研究结果来激发边界保护策略,该策略保留 BF16 中的前两个和最后三个块,同时使用 W8A8 HiF8 量化剩余的 35 个块。所提出的 PTQ 方法在评估的所有五个 VBench 维度上均匹配或略微超过 BF16 基线,表明在 5 个提示评估集中没有可测量的准确性损失。对四种保护配置的消融研究证实,完整的边界保护可产生最高的平均 VBench 分数,从而验证了数据驱动的块选择。我们还研究了量化感知训练(QAT)作为 微调 阶段的补充,并分析了它在单卡硬件上无法超越普通 PTQ 的条件。