论文

EFQ-Softmax:Softmax 的无Exp 量化

EFQ-Softmax: Exp-Free Quantization for Softmax

摘要

低位注意力通过将 $QK^\top$ 和 $PV$ 矩阵乘法移至 FP8 或 FP4 矩阵引擎来加速 Transformer 推理。然而,softmax 路径通常以更高精度评估移位分数指数,形成临时概率块,并在低位 $PV$ 乘法之前对其进行量化。这种先指数后量化的路径会在高精度概率生成器和低位矩阵消费者之间造成不匹配。我们提出了 EFQ-Softmax(Softmax 的无指数量化),这是一种低位概率生成方法,可将转移的注意力分数直接映射到块尺度的 E2M1 操作数。 For each microscaling block, EFQ-Softmax selects an exponent-only scale from the local maximum, maps the shifted scores to a normalized residual domain, and generates nonnegative E2M1 probability codes using a single affine rule.生成的操作数在 $\widetilde{P}V$ 分子更新和 $\widetilde{P}\mathbf{1}$ 分母更新中一致使用。 FlashAttention式的行最大更新、历史缩放、高精度累加和最终归一化保持不变。我们评估 Qwen3-8B、Qwen3-VL-8B-Instruct 和 WAN2.2-TI2V-5B 上的端到端质量,并单独测量 A5 向量单元上的内核级性能。 EFQ-Softmax 将使用 MXFP4 的 Qwen3-8B 七任务平均值从 0.6749 提高到 0.6773,将 Qwen3-VL 九任务平均值从 0.7826 提高到 0.8000。在 WAN2.2 上,它保持了与 VBench 下的 FP16 和 MXFP4 基线相当的时间一致性和视觉质量。在 A5 向量单元上,EFQ-Softmax 在序列长度从 16K 到 128K 的范围内将融合概率生成内核的向量阶段延迟平均降低了 40.33%。这些结果表明,直接低比特概率生成可以取代传统的先进行量化路径,同时保持端到端模型质量。