论文

超越准确率与成本:面向动态工作负载的延迟感知LLM查询路由

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

AI 基础设施推理服务

摘要

现代语言查询路由器通过把每个查询分配给平衡响应质量与货币成本的模型来提升推理效率。但当前查询路由器大多不感知延迟,不考虑查询在模型实例上经历的生成延迟。实践中,延迟常由轮询或最短队列等负载均衡策略控制,而它们不考虑模型准确率与推理成本。把查询延迟纳入路由具有挑战性:延迟不仅取决于查询提示长度,还取决于模型实例当前的prefill与解码负载、以及服务框架的调度与批处理策略。我们设计一个轻量延迟估计器:在服务框架中模拟自回归token批处理,估计查询的time-to-first-token(TTFT);并把该估计器纳入延迟感知路由器,在为查询分配模型实例时联合优化延迟、准确率与成本。实验结果表明,这一联合优化在保持与标准负载均衡相同延迟的同时,准确率—成本效用最高提升40%。

超越准确率与成本:面向动态工作负载的延迟感知LLM查询路由:论文配图
图 3:令牌批量处理时间估计器。方程中的估计量。 9 与观察到的批时间非常匹配,令牌批组合的平均绝对百分比误差约为 4%\approx\!4\%(对于托管在一个 H100 GPU 上的 Qwen3-0.6B)。