技术实践
腾讯混元AI Infra团队开源 HPC-Ops 提升大模型生产推理吞吐
概述
腾讯混元AI Infra团队开源生产级LLM推理算子库 HPC-Ops,用 CUDA 与 CuTe 从零构建。主流算子库多以 H800 等高配训练卡为优化目标,而国内大规模线上推理常用 H20 等推理卡,现有实现难以逼近硬件峰值,核心 Kernel 封装深、二次开发门槛高。团队围绕 Attention、FusedMoE、GroupGEMM 做指令对齐、数据预取、任务调度与数据重排:对 Decode Attention 与小 batch GroupGEMM 做 AB 矩阵交换以对齐 wgmma 指令,访存带宽达硬件峰值80%以上;并以 vec 抽象层隔离 Tiling 细节,降低开发门槛。官方称真实场景下混元端到端 QPM 提升30%、DeepSeek 提升17%;单算子上 Attention 较 FlashInfer/FlashAttention 最高提升2.22倍,GroupGEMM 较 DeepGEMM 最高提升1.88倍,FusedMoE 较 TensorRT-LLM 最高提升1.49倍。文中称已在腾讯大规模生产环境验证,代码在 GitHub 开放,可对接 vLLM、SGLang,原生支持 BF16/FP8;对比数字多为特定规格与精度下的最高值,复现时需注意测试条件。