论文

TeDiServe:用于扩散语言模型的高 SLO 成就

TeDiServe: High SLO Attainment Serving for Diffusion Language Models

AI 基础设施推理服务

摘要

扩散语言模型(DLM)最近已成为传统自回归语言模型的有前途的替代方案。通过在每个去噪步骤中并行生成多个词元,它们可以提供更高的推理吞吐量,同时保持有竞争力的质量。然而,要实现这些吞吐量增益,同时满足服务系统中的延迟 SLO,需要解决 DLM 独特特性带来的挑战。其中包括通过基于置信度的去噪实现速度与质量的权衡,在负载波动的情况下跨模型实例选择适当的并行化级别,以及协调引入非均匀每步成本的近似 KV 缓存机制。为了应对这些挑战,我们推出了 TeDiServe,这是一个用于 DLM 的集群级服务系统。 TeDiServe 通过置信阈值调整实现截止时间感知调度和自适应负载控制,并通过解决质量感知优化问题动态重新配置集群,同时对近似 KV 缓存引入的步骤级异构性进行显式建模。在多个基准测试和实际跟踪中,TeDiServe 将 SLO 提高了高达 56.6 个百分点,并将端到端请求延迟降低了高达 46%,同时准确率下降了不到 1%。