论文
TokenRouter:Token级LLM路由的高效服务系统
TokenRouter: Efficient Serving System for Token-Level LLM Routing
摘要
大型语言模型 (LLM) 路由将推理工作分配到不同的模型中,从而推进了 LLM 服务的成本质量帕累托前沿。虽然会话或查询级别的粗粒度路由已在生产系统中广泛采用,但最近的算法研究表明,细粒度token级别路由可以带来显着的效率和质量提升。然而,有效地提供token级路由推理对现有系统提出了重大挑战。当前的系统基于单LLM假设,在token级路由下存在严重的步骤不同步和频繁的批量准入延迟,并且还给开发人员带来了很高的实现复杂性。为了应对这些挑战,我们设计了 TokenRouter,这是一个高效且对开发人员友好的服务系统,用于token级路由 LLM 推理。 TokenRouter遵循以请求为中心的编程、以模型为中心的执行的原则:开发者从单个请求的角度描述路由逻辑,而运行时为每个LLM启动一个子服务器并调度请求 异步地。每个子服务器都采用延迟批处理调度程序,其最佳超参数源自系统的数学吞吐量模型。在不同的路由算法、工作负载和模型对中,TokenRouter 的解码吞吐量比现有系统高 2.01-64.15 倍,大幅提高了token级 LLM 路由的服务效率。我们的代码可在 https://github.com/thu-nics/TokenRouter. 获取