论文

FluidPD:面向 SLO 的预填充与解码 worker 就地弹性重配

FluidPD: In-Place Elasticity for SLO-Aware Prefill-Decode Disaggregated LLM Serving

AI 基础设施推理服务

摘要

预填充与解码分离已成为常见的 LLM 服务架构,因为两阶段具有不同执行模式与服务等级目标(SLO)。现有系统通常采用固定的预填充/解码工作进程比例,并在进程之间路由请求。然而,真实负载既会短暂突发,也会持续改变两阶段需求比例,使原本充足的配置迅速失配;即使其他位置仍有空闲容量,也可能违反延迟 SLO。现有自动扩容反应较慢,需要备用 GPU,也不能直接解决短时阶段失衡。我们提出 FluidPD,以 SLO 感知的原地弹性支持 P/D 分离服务。FluidToken 在解码侧有余量时,将有限的预填充计算卸载到解码进程,处理短暂失衡;FluidRole 在不重载模型或重启引擎的情况下,原地切换运行进程的预填充和解码角色,处理持续失衡。两者由轻量压力指标引导,在 SLO 违规出现之前识别两侧资源压力。在 Azure 生产轨迹负载上,FluidPD 相比静态 SGLang 的整体 SLO 达标率最多提高94.6个百分点,说明无需增配进程也可改善服务质量。

FluidPD:面向 SLO 的预填充与解码 worker 就地弹性重配:论文原图
图 13:FluidPD 使用的延迟模型的准确性。 MRE 表示平均相对误差。