论文

先校准再路由:解耦大模型服务的学习式请求调度实测

Calibrate, Then Route: A Measured Study of Learned Request Routing for Disaggregated LLM Serving

AI 基础设施推理服务

摘要

解耦大模型服务把计算密集预填充与内存密集解码置于不同GPU池。DistServe、Splitwise、Mooncake等加速这一分离,但路由仍决定实例分配。我们研究利用精确提示长度、预测输出长度、接纳后KV压力与SLO类别,估计各实例额外完成时间的路由器。在离散事件模拟器开发策略,再用八张NVIDIA A40、每张运行vLLM、NIXL传输池间KV验证,所有负载在实测饱和点运行。三种混合突发到达轨迹上,校准路由器平均有效吞吐最高0.864,对照轮询、最少负载和长度启发式为0.835—0.847,跨轨迹方差也最低。它在三条轨迹均胜轮询和长度启发式,两条胜最少负载;第三条落后0.003,在运行噪声内。硬件校准关键:模拟常数损失4.5个有效吞吐点及约40%尾延迟优势,使评分器近似退化为数队列。收益随解码池和流量异质性增加,在三实例池中消失,此时队列数常足够。极端稀缺时,贪心最小成本把请求集中到最低分实例,盲目分散反而更好。成本校准后,学习式路由用六张GPU达到轮询七张的有效吞吐。

先校准再路由:解耦大模型服务的学习式请求调度实测:论文配图
图1:研究总览。预填充/解码拆分消除了两阶段干扰,但仍需为每个请求选择实例,而这一决策通常缺少信息。学习式路由器根据请求准入时的特征估计各候选实例的代价,并在真实vLLM/NIXL集群上验证。