论文

VC-Attention:用值向量平滑与融合Softmax转换加速低比特注意力

VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

摘要

Diffusion Transformers 提供最先进的视频生成,但其长时空序列使人们关注主要的部署成本,并且可部署的低位内核必须准确且快速。准确性受到异常值的限制:块的量化比例由其最大条目设置,而典型条目仅限于可表示值的狭窄范围。先前的工作平滑了查询和键,但值异常值不遵循固定的通道或时空结构,并且仍然是输出误差的主要来源。速度受到softmax的限制:低位Tensor Core仅加速两个矩阵乘法,因此它们之间的高精度指数成为数据中心GPU上最长的管道阶段。我们提出了 VC-Attention,这是一种免训练的低位注意力框架,通过将值平滑与融合概率 Cast 配对来解决这两个问题。 V-Smooth 通过轻量级在线集群对值向量词元进行重新排序,因此硬件块中的词元可以很好地一起量化。它仅量化减去块均值后的残差,并从在线 softmax 已维护的行总和中恢复该均值。 ExpCast-FP8 通过一次融合乘加将对数域分数直接映射到 E4M3 概率代码,从而消除了 FP32 指数和格式转换。我们为 B200、B300、H200、RTX PRO 6000 和 RTX 5090 实施 VC-Attention。在 Wan2.2、LongCat-Video、HunyuanVideo-1.5 和 MiniMax-H3 中,VC-Attention 提高了低位基线的保真度,在数据中心上将注意力内核速度比 BF16 FlashAttention-4 提高了 1.46-1.59 倍Blackwell 和 Hopper 在工作站卡上的速度提高了 2.3-3.6 倍,生成的剪辑速度端到端速度提高了 1.13-1.19 倍和 1.36-1.70 倍。