论文
RequestRouter:用于高效单 GPU LLM 推理的请求边界路由
RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference
摘要
RequestRouter 是一个轻量级请求边界控制器,用于减少单 GPU 大语言模型 推理的延迟和能源成本。该系统不是使用一种静态配置来服务所有请求,而是使用廉价的请求级功能为每个请求选择一种固定推理模式,包括 FP16、量化推理、推测解码、前缀缓存、连续批处理以及混合模式,例如 GPTQ 加前缀缓存和 INT8 加连续批处理。我们使用 NVIDIA A100 GPU 上的 vLLM 提供的 8B 指令调整语言模型来评估 RequestRouter。在全面的 A100 评估中(26,500 次固定模式评估,随后进行 3,500 次在线控制器评估,总共 30,000 次测量推理执行),控制器实现了 FP16 的 2.10 倍平均延迟加速,以及部署型工作负载的 0.48 倍能量比。通过重复测量进行较小的匹配评估,可以对此结果进行受控统计检查:RequestRouter 保留了 1.93 倍的延迟加速(95% CI:1.88--1.98 倍)和 0.523 的能量比(95% CI:0.506--0.540),表明在更严格控制的协议下,增益仍然存在。在单独的扩展自动基准评估中,路由策略保留了 99.6% 的 FP16 宏观精度。 100,000 次调用的 CPU 微基准测试仅测量 0.00475 毫秒的平均路由开销 (0.00532 毫秒 p99)。因此,简单的请求感知路由可以恢复显着的服务效率,而无需重新训练或修改底层 LLM。