论文
LLM 突发负载分配下的推理:修改WAIT算法
LLM Inference Under Bursty Workload Distribution: Modifying the WAIT Algorithm
摘要
ChatGPT 和 Claude 等 大语言模型 (LLM) 广泛用于信息检索和问题解决。最近的工作重点是改进调度算法以提高吞吐量,同时保持低延迟。然而,这些方法通常假设泊松请求以恒定速率到达 - 这种假设无法反映现实世界流量固有的突发性和动态性质。我们提出了对最先进的 WAIT 算法 [1] 的轻量级扩展,该算法无需先验流量知识即可适应随时间变化的到达率。所提出的算法根据观察到的到达间隔时间来在线估计请求强度。使用基于马尔可夫调制泊松过程 (MMPP) 的合成工作负载和不同的请求类型,我们进行了基于模拟的评估,证明所提出的方法在评估的低到达率转移场景中实现了比 Sarathi-Serve [2]、ORCA [3] 和 vLLM [4] 更高的吞吐量,同时保持了相当的延迟。