SLO-Guard:针对 SLO 受限的 LLM 服务进行崩溃感知、预算一致的自动调整
SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving
摘要
在延迟服务级别目标 (SLO) 下提供 大语言模型 是一个配置繁重的系统问题,具有异常容易出现故障的搜索空间:许多合理的配置彻底崩溃或错过用户可见的延迟目标,而标准黑盒优化器将这些故障视为浪费的试验。我们推出了 SLO-Guard,这是一种用于 vLLM 服务的崩溃感知自动调节器,它将崩溃视为一流的观察结果。 SLO-Guard 将可行优先的热预算退火 (TBA) 探索阶段与热启动树结构 Parzen 估计器 (TPE) 开发阶段相结合;切换会重播所有探索历史,包括编码为极端约束违规的崩溃。我们还提供了一个配置修复通道、一个 GPU 感知的 KV 缓存内存防护和一个四类崩溃分类法。我们在 NVIDIA A100 40GB 上使用 vLLM 0.19 来评估 Qwen2-1.5B 上的 SLO-Guard。在预先指定的五种子研究中,SLO-Guard 和统一随机搜索都达到了 75/75 的可行性,在纠正的并发控制下零崩溃,并且在统计上与最佳实现的延迟相关(Mann-Whitney 两侧 p=0.84)。 SLO-Guard 的优势在于预算一致性:快速服务体制中的试验次数更多(10.20 比 7.40,共 15 次;单边 p=0.014),并且切换后一致性更高(0.876 比 0.539;p=0.010)。在并发负载下,SLO-Guard 的最佳延迟交叉种子标准偏差比随机搜索严格 4.4 倍(2.26 毫秒 vs. 10.00 毫秒)。Harness复制分析表明,一致性结果在独立的顺序调度测量条件下仍然存在。核心主张并不是 SLO-Guard 找到了更好的最终配置,而是一旦找到快速机制,它就会更可预测地花费固定的调整预算。