论文

通过无损压缩减少 ML 的 GPU 内存瓶颈 - 扩展

Reducing the GPU Memory Bottleneck with Lossless Compression for ML -- Extended

AI 基础设施数据基础设施

摘要

机器学习 (ML) 训练和推理经常处理远远超出 GPU 内存容量的数据集,迫使它们依赖 PCIe 进行按需张量传输,从而造成严重的传输瓶颈。有损压缩已被提出来缓解瓶颈,但会带来与工作负载相关的准确性损失,使其变得复杂,甚至无法在现有的 ML 部署中使用。我们探索无损压缩作为避免这种部署复杂性的替代方案。我们确定了无损压缩可以集成到机器学习管道中的位置,同时最大限度地减少对 GPU 执行的干扰。根据我们的发现,我们引入了不变位打包 (IBP),这是一种新颖的无损压缩算法,旨在最大限度地减少 ML 的数据传输时间。 IBP 识别并消除张量组之间的不变位,通过利用扭曲并行性、低开销位操作和异步 PCIe 传输的 GPU 优化解压缩来提高吞吐量。我们提供易于使用的 API,通过向 GNN 训练添加 IBP 支持以及 DLRM 和 LLM 推理框架来展示它们。平均而言,IBP 的 GNN 训练速度提高了 74%,DLRM 嵌入查找速度提高了 180%,LLM 推理速度提高了 24%。