论文
面向边缘智能体服务的低延迟与负载均衡请求调度
End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services
摘要
大模型驱动的智能体服务日益需要低延迟推理,推动模型部署到分布式边缘服务器。异构通信与计算能力及动态推理状态,使每个请求的服务器选择随时间变化且跨时隙紧密耦合。本文研究在线调度框架,联合最小化长期平均端到端延迟并调节异构服务器负载分布。挑战有二:传统延迟模型不能准确捕捉多阶段执行的细粒度动态;调度延迟后果只有请求完成后才可观测,难以即时评价决策。我们建立跨时隙推理模型,描述不同请求的传输、预填充、迭代级解码及KV缓存演变,并用KV缓存内存—时间消耗指标刻画负载。提出的LYREO以Lyapunov优化转换长期负载均衡约束,通过基于序列回报预测的奖励重分配,将延迟结果转为早期决策的及时学习信号。多种配置模拟显示,LYREO相较代表性学习式与启发式基线持续获得更低延迟和更均衡负载。
