论文

使用策略梯度的自适应推理批处理

Adaptive Inference Batching using Policy Gradients

AI 基础设施推理服务

摘要

推理服务系统必须在突发、异构工作负载下平衡吞吐量和延迟,但行业标准仍然是静态批处理策略,需要手动调整并且无法适应不断变化的流量。我们研究强化学习 (RL) 是否可以学习优于这些启发式的自适应批处理和路由策略,在根据排队理论和生产跟踪(Azure Functions、BurstGPT)进行验证的离散事件模拟器上训练 REINFORCE 和 PPO 代理。我们将问题表述为关于队列状态、请求类型和 GPU 可用性的 MDP,对标准泊松流量、极端突发、真实世界跟踪和异构多 GPU 路由进行评估。我们的中心发现是强化学习在系统问题中的价值有一个明确的边界条件。在单 GPU 设置中,经过良好调整的静态批处理策略在类泊松到达下已经接近最佳,而 RL 仅提供边际增益(+0.1% 至 +1.0%)。然而,在多 GPU 异构路由中,快速和慢速请求竞争共享资源,代理发现了一种工作负载隔离策略,可以消除队头阻塞,比循环法提高 3.5 倍 (348%),比最强启发式基线(最短队列)提高 48%,在遵守 SLA 约束的同时,吞吐量提高 60%,延迟降低 25%。尽管仅对合成泊松到达进行训练,并且注意力增强策略网络的收敛速度比 MLP 基线快大约 20%,但该策略仍可推广到看不见的突发流量和现实世界流量。这些结果表明,RL 相对于工程启发式的优势集中在组合、多资源决策,而不是单资源时间调度,这是决定学习策略在生产推理基础设施中证明其工程成本合理的实际区别。