论文

测量和减少 LLM 推理的 WebGPU 调度开销

Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference

AI 基础设施可观测性

摘要

大语言模型 部署到多种类型的环境中,从互联网浏览器到边缘设备,WebGPU 作为现代跨平台标准。基于浏览器的 LLM 推理引擎已经激增,但 WebGPU 每个操作调度的开销仍然很少被描述。在这项工作中,我们引入了一种顺序调度测量方法,并表明,通过将调度与同步混为一谈,简单的单操作测量会高估每次调度成本。使用我们的方法,我们测量每次调度成本并表明它与所使用的数据类型无关。我们表明,批量大小为 1 时的瓶颈是调度开销,而不是内核质量,并将调度计数作为原因。因此,我们得出结论,在批量大小为 1 时,WebGPU 中 LLM 推理优化的有效方法是减少调度计数。我们的研究结果指出,在推理引擎和 WebGPU 规范中,分派摊销是实现基于浏览器的实用推理的途径。