论文

AgentServeSim:LLM 代理程序的服务系统模拟和策略搜索

AgentServeSim: Serving-System Simulation and Policy Search for LLM Agent Programs

AI 基础设施推理服务

摘要

大语言模型 代理执行的程序包含与外部工具调用交错的多个模型轮次。他们的工作完成时间取决于服务系统如何跨工具间隙保留 KV 状态、路由后继轮流以及安排竞争程序。大多数现有的服务模拟器都在请求流上运行,其中到达是外部提供的,并且 KV 状态遵循请求或缓存范围的语义。因此,它们不能共同代表评估反事实代理服务轨迹所需的交叉状态和政策依赖的后继版本。我们提出了 AgentServeSim,一个模拟器,其执行单元是代理程序。程序控制块维持交叉转弯状态,而程序编排器则从模拟的前驱完成中因果地释放后继转弯。保留平面控制跨工具间隙的 KV 状态,调度平面确定每个就绪轮次的执行位置和时间。我们在跨越两个 GPU 平台 Llama-3.1-8B 和 Llama-3.1-70B、编码和函数调用代理以及五种到达率的 20 个配对模拟器-真实单元中针对真实 vLLM 部署来验证 AgentServeSim。 B200 上的平均 JCT 误差保持在 5.5% 以内,而在饱和 RTX PRO 6000 状态下,平均 JCT 误差保持在 5.2% 以内。最后,我们提出 LLM 驱动的自动化代理服务策略搜索,使用 AgentServeSim 作为基于 CPU 的适应度评估器。由此产生的策略比手写种子策略的平均 JCT 在 KV 保留方面提高了 0.5%,在调度方面提高了 2.8%。