论文

MXAttention:MXFP4 Attention 的无数据最优缩放和预归一化量化

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

摘要

注意力的二次成本是基于扩散的视频生成模型的主要瓶颈。 MXFP4 注意力为高效推理提供了一条有希望的途径,但由于两个数值问题,直接 MXFP4 量化通常会降低生成质量:二次幂缩放的削波下溢权衡以及 softmax 循环中引入的行归一化误差。我们提出了 MXAttention,一个用于 MXFP4 注意力的无数据 后训练 量化框架。 MXAttention 引入了两个组件:通用最优缩放 (UOS),它利用二次幂微缩放的周期性结构来导出与分布无关的最优缩放边界 Qmax=7.25,无需校准或搜索;以及预归一化量化 (PNQ),它在行求和之前量化非归一化的 softmax 指数,以通过构造保持归一化。 Wan2.2 和 HunyuanVideo 上的实验表明,MXAttention 缩小了 OCP MXFP4 和 FP16 之间至少 95% 的 VBench 成像质量差距,显着提高了帧级相似性,并保留了 FP16 级别的生成质量,所有报告的 VBench 指标的绝对降级均小于 0.01。 MXAttention 还实现了与基于 NVFP4 的强大基线竞争的性能,当融合到注意力管道中时,开销可以忽略不计。该实现已在 MindIE-SD 中公开发布。