论文

评估 Hopper 和 Blackwell GPU 上 AI 工作负载的 CUDA Tile

Evaluating CUDA Tile for AI Workloads on Hopper and Blackwell GPUs

摘要

NVIDIA 的 CUDA Tile (CuTile) 引入了一种基于 Python、以 Tile 为中心的 GPU 内核开发抽象,旨在简化编程,同时保留现代 GPU 上的张量核心和张量内存加速器 (TMA) 效率。我们针对 Hopper 和 Blackwell 的三个 NVIDIA GPU(H100 NVL、B200 和 RTX PRO 6000 Blackwell 服务器版)上的 cuBLAS、Triton、WMMA 和原始 SIMT 等既定方法,对 CuTile 进行了首次独立的跨架构评估。我们对代表性 AI 工作负载(包括 GEMM、融合多头注意力以及 BF16/FP16 精度的端到端 LLM 推理)进行基准测试,以评估性能和可移植性。我们的结果表明,CuTile 的有效性很大程度上依赖于工作负载和架构。在数据中心级 Blackwell (B200) 上,CuTile 的融合注意力速度高达 1007 TFLOP/s,性能比 FlashAttention-2 高出 2.5 倍,同时仅需要 60 行 Python 内核代码。对于 GEMM,CuTile 在 22 行代码中达到了 cuBLAS 性能的 52-79%(WMMA 为 123 行),使其成为手写 CUDA 内核的实用替代品,但尚未成为供应商优化库的替代品。然而,相同的 CuTile 注意力内核在 RTX PRO 6000 (sm_120) 上仅实现了 FlashAttention-2 吞吐量的 53%,暴露了显着的跨架构优化差距。相比之下,Triton 在所有测试平台上保持了 62-101% 的 cuBLAS 性能,无需进行特定于架构的调整,表现出更强的可移植性。