论文

MAPS:大模型服务的内存感知预测调度

MAPS: Memory-Aware Predictive Scheduling Framework for Large Language Model Serving

AI 基础设施推理服务

摘要

个人设备上大模型应用增长给云服务带来大量突发负载。预填充与解码分离虽改善吞吐和扩展性,内存受限解码实例却因请求到达时输出长度未知,常持续负载不均。我们提出面向解耦服务的内存感知预测调度框架MAPS,将设备辅助的推测输出长度预测与云端预填充重叠,额外延迟可忽略。为处理生成不确定性,它通过不确定性感知校准导出具有目标覆盖率的长度上界,支持安全调度。依据上界采用全局—局部分层调度,减轻解码器间队列积累和单解码器队首阻塞。在两个真实负载、两个大模型上的大量实验中,MAPS显著优于三种先进系统。原摘要报告平均端到端延迟降幅42.6、尾延迟降幅最高84.8,但未注明这两个数值的单位。

MAPS:大模型服务的内存感知预测调度:论文配图
图 2:MAP 概述。 MAPS 由三个路径组成:(i) 推理路径(黑色),其中请求由预填充器和解码器处理; (ii) 预测路径(橙色),其中推测长度预测和不确定性感知校准估计未来的内存需求; (iii) 状态反馈路径(蓝色),收集运行时状态以指导调度决策。