论文

词元之下:GPU 加速 LLM 推理中多词元预测的性能工程研究

Beneath the Tokens: A Performance Engineering Study of Multi-Token Prediction in GPU-Accelerated LLM Inference

模型推理投机采样

摘要

自回归大语言模型推理会重复调用目标模型一次生成一个词元,从而使生成对 GPU 内存移动和顺序执行敏感。本研究评估了 NVIDIA A10G GPU 上受控单请求部署中的双词元多词元预测 (MTP) 与自回归解码。 360 度请求基准测试涵盖纯文本、推理密集型和工具调用工作负载,同时使用运行时遥测、Nsight 系统、PyTorch Profiler 和选定的 Nsight 计算测量来解释观察到的性能。 MTP 将所有提示的输出吞吐量提高了 \(1.91\times\) 到 \(2.19\times\),并将首次输出的时间缩短了 10.0--14.2\%。每次验证迭代的平均接受长度中位数范围为 2.370 到 2.595 个词元。分析显示,MTP 引入了更长、更复杂的执行路径,包括提案、采样、注意力、收集和归约操作。然而,每个生成的词元所需的所选重复 CUDA 图形的执行次数减少了 56.4--78.1\%。占主导地位的 MTP GEMM 内核并不比占主导地位的自回归 GEMV 内核快,并且两者的选定实例都接近 A10G 内存带宽限制。这些结果表明,MTP 通过摊销改进了推理:更大的词元进度减少了重复的 GPU 执行,足以超过额外的推测执行成本。