技术实践

腾讯云以算子、通信和量化优化DeepSeek推理

模型推理模型架构模型优化MoE推理加速批处理与并行分布式推理量化

概述

腾讯云团队以 DeepSeek R1/V3(671B 总参数、MoE 单 Token 激活 37B、61 层、MLA 低秩压缩)为对象,在英伟达 H20(单卡 FP8 峰值 296 TFLOPs)上按算力、显存、显存带宽、通信带宽四大资源做全层级优化并给出公式化测算方法:减少 Prefill 方面,vLLM 集成 LMCache 作为缓存引擎并对接 NitroFS 远程存储,支持本地+远程混合缓存与多副本动态扩容,某些场景 20% 输入重复可减少 16% Prefill 计算。 消除 CPU-GPU 交互空泡(上下文空泡与内存碎片空泡)后 Decode 性能提升 10%+。算子融合方面,MoE 专家选择由 18 个独立 Kernel(含 GEMM、Softmax、Top-K、gather/scatter/argsort)融合为 2 个,算子级加速 10 倍,W4A8 的 Pre-Quant 与 Expand Row 融合节省 50% 显存带宽,Metadata 融合使端到端耗时降低 2%~3%。 PD 分离与并行调优方面,Prefill 节点 TP8+EP8 相比 TP1 通信耗时仅增约 0.005s、推理耗时节约约 0.08s,Decode 节点改用 DP+EP 后 DP8 使单机 throughput 提升 50% 以上,32 Batch 下 EP8/EP16/EP32 单 Token 耗时分别为 0.0137/0.0168/0.0185 秒(逼近 50 Tokens/s 的 0.02 秒上限)。 通信方面,基于 DeepEP 叠加腾讯网平团队 TRMT 做控制面 Bypass CPU(控制面时延由 3us 降至 0.5us)、数据面 PTX 级 Bypass L2 缓存控制与双端口网卡动态 QP 分配拥塞控制,优化前通信算子耗时占比 40%+,优化后通信算子耗时减少 60%,并以 NIXL 直接以 KVCache 为源/目的经 RDMA GDR 零拷贝传输,相比 NCCL 实战有 3%~4% 收益(长输入 ISL>8k 走 Layerwise 传输、短文整体传输并做小包合并)。 节约资源方面,MoE 层做 W4A8/INT4 量化(AWQ 保护敏感通道、group-size=128、FP8 静态 per-tensor 量化,前三层 Dense 与 LM Head 不量化),H20 单机 8 卡即可部署 DeepSeek,在 DeepGEMM 基础上支持 INT4 高效计算,相较两机 FP8 部署 QPM 提升 50% 以上。