论文

FleetSieve:SLO 感知 LLM 队列配置的决策关键分析

FleetSieve: Decision-Critical Profiling for SLO-Aware LLM Fleet Configuration

AI 基础设施推理服务

摘要

为 LLM 服务队列选择张量并行 (TP) 度和副本数量很困难,因为 TP 中的性能不是单调的,并且可行的选择可能会随负载而变化。详尽的分析解决了这种不确定性,但测量了许多不影响最终资源分配的配置。我们提出了 FleetSieve,它根据测量对资源耦合、SLO 感知的车队决策的预期影响来选择测量。 FleetSieve 联合对容量和尾部延迟进行建模,比较保守和乐观的分配,并在剩余决策差距低于指定容差时停止。在 31B 参数开放权重模型的固定 H100 测量网格上,FleetSieve 使用 22,200 GPU 秒达到预言机聚合决策,比固定比较中的均匀随机分析少 6.9%。在 200 个随机显示订单中,与随机分析相比,平均节省了 5.4%(95% bootstrap CI:3.5-7.2%)。聊天的固定比较节省为 21.5%,而 FleetSieve 的代码使用的 GPU 秒数并不是最少的。联合容量和尾部建模还避免选择 46.4 秒完成 p99 违反 30 秒 SLO 的配置。在 16-GPU 分配中,不正确的稀疏配置文件决策会导致每秒最多丢失 1.93 个请求和 12.4 个百分点的最大最小履行率。边界重复和 BurstGPT 测量支持观察到的负载相关尾部延迟机制。