开源项目
Open-VC Attention 公开 Blackwell FP8 长序列注意力实现
MachGen's VC attention (https://arxiv.org/html/2609.15810v1) implementation. 2x faster (compared to 1.47-1.6x in original paper) FP8 attention on Blackwell than BF16 FlashAttention for long sequence video inference.
概述
Open-VC Attention 是面向NVIDIA Blackwell B200/B300的FP8前向注意力实现,采用BSD-3-Clause,基于FlashAttention-4并实现VC-Attention的ExpCast。它将缩放融合进分数转换,采用中段键遍历更早稳定运行最大值、warp专门化流水线、打包V布局和B200融合输入准备,并提供可选V残差修复。需Linux、Python3.10以上、CUDA13版PyTorch及对应GPU;接口接受FP16/BF16输入、头维128,长非因果序列32768以上走快速路径。目标日固定版本以MiniMax-H3某一步/层的QKV激活、S=73397、7/14/56头在B200对比FA4 BF16;完整调用包含输入准备,报告1.97—2.00倍,算子内核约2.00—2.03倍。数据为作者随机交错顺序、CUDA Graph重放的测量,原激活私有,仅保存哈希;并不是整模型或生成任务提速。常规所测层相对L2误差约2.98—3.19%,但末层Q/K量化造成约57.2%误差,残差修复也不能消除这一边界,因此原模型采用BF16的敏感层须维持BF16,并核真实模型输出质量。