论文
用于低延迟 大语言模型 推理的混合 JIT-CUDA 图优化
Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference
摘要
大语言模型 (LLM) 在自然语言和多模式任务中取得了强大的性能,但其实际部署仍然受到推理延迟和内核启动开销的限制,特别是在交互式、短序列设置中。本文提出了一种混合运行时框架,它将即时 (JIT) 编译与 CUDA 图形执行相结合,以减少启动开销,同时在自回归解码期间保持运行时灵活性。该框架将 Transformer 推理划分为通过 CUDA 图形重放执行的静态组件和通过 JIT 编译的内核处理的动态组件,从而实现异步图形捕获和跨解码步骤的重用。我们在 LLaMA-2 7B 上使用单 GPU、批量大小为 1 的提示长度(从 10 到 500 个词元)进行推理来评估所提出的方法。实验结果表明,与该方案中的 TensorRT-LLM 相比,混合运行时将首次词元时间 (TTFT) 减少了高达 66.0%,并实现了更低的 P99 延迟。这些结果表明,混合 JIT-CUDA 图形执行可以有效减少短序列 LLM 工作负载的推理延迟和方差,使其成为延迟敏感型 AI 应用程序的实用优化策略。