论文

表面去噪:建模和预测扩散 LLM 服务的推理成本

Denoising Surface: Modeling and Predicting Inference Cost for Diffusion LLM Serving

AI 基础设施推理服务

摘要

随着扩散大语言模型 (dLLM) 的能力变得越来越强大,它们正在从研究环境转向现实世界 serving,其中请求管理(例如调度和资源分配)依赖于对每个请求推理成本的准确估计。然而,常见的成本代理对于 dLLM 来说是不够的:输出长度忽略了一次前向传递可以揭露多个词元,并且去噪步骤计数忽略了 heterogeneous 每步成本。我们观察到,块自回归生成机制在输出块和块内去噪步骤上引入了二维执行结构,而这些代理将其折叠成标量,丢弃了表征成本所必需的信息。受这一见解的启发,我们提出了去噪工作负载表面(DWS),它将二维块步骤结构保留为概率表面,以加权异构每步骤成本。然后,我们设计了一种从粗到精的训练方案,使轻量级仅提示预测器能够准确预测复杂的 DWS。即使在单个 CPU 核心上,该预测器也能高效运行,从而避免 GPU 与服务模型发生争用。由于 DWS 将依赖于请求的执行行为与特定于部署的成本因素解耦,因此预测器无需重新训练即可跨硬件配置进行传输。在 real-world 服务实验中,与基于标量的预测器相比,DWS 将成本预测误差减少了 $2.50\times$,而 DWS 引导的最短作业优先调度程序将在线聊天机器人的端到端延迟减少了 $1.92\times$。