论文
用于分类 GPU 推理的拓扑感知数据移动
Topology-Aware Data Movement for Disaggregated GPU Inference
摘要
分解的 LLM 推理会产生一个现有系统无法正确解决的数据中心网络问题。当预填充和解码在不同的 GPU 池上运行时,必须在它们之间传输 KV 缓存。对于 70B 型号,每个请求为 1.3 GB,在生产规模上超过 100 GB/s 聚合。然而,DistServe、Splitwise 和 Mooncake 都使用统一的 RDMA,忽略了两个 GPU 之间的带宽根据其物理关系而变化了 72 倍:域内通过 NVLink 4.0 实现 900 GB/s(NVLink 5 实现 1.8 TB/s,差距扩大到 144 倍),跨节点通过 InfiniBand 实现 50 GB/s,跨数据中心通过 TCP 实现 12.5 GB/s。我们设计了一个拓扑感知的传输编排器,它在启动时发现互连层次结构,并为每次传输选择最佳传输。三种机制协同工作:(1) 管道式逐层传输,将传输与正在进行的预填充重叠,根据传输方式将 76% 到 100% 的传输延迟隐藏在计算后面,并完全隐藏 NVLink 和 PCIe 传输; (2) NVLink 专家混合模型的域感知布局,可与 KV 缓存局部性共同优化专家调度; (3) CXL 3.0 内存扩展器作为共享溢出层,提供 6 倍的容量,同时延迟比 NVMe 低 86 倍。全面评估需要具有异构互连的多节点集群和 CXL 3.0 硬件,这超出了学术资源范围,并且尚未在 GPU 云中提供。我们展示了跨三种架构的分析带宽模型、组件实现和预测分析,显示比统一 RDMA 传输延迟减少了 3 至 18 倍。