论文
在Agentic服务中通过学习智能体执行来管理KV缓存
Learning Agent Execution for KV-Cache Management in Agentic Serving
摘要
多智能体LLM系统已成为AI服务的重要部署范式,其中每个用户请求被分解为一系列专用智能体。在这些工作流中,每个智能体反复执行由系统提示、工具定义与少样本示例构成的固定上下文,为KV缓存复用创造了大量机会。然而,现有LLM服务系统以被动方式管理KV缓存:采用前缀缓存与基于近期性的替换,导致可复用的智能体上下文在下一次调用前就被逐出,迫使重复计算。我们提出CacheScout,一个面向多智能体LLM服务的智能体感知KV缓存运行时层。其关键洞见是:未来的KV缓存复用由智能体执行语义而非缓存近期性主导。CacheScout通过在线学习智能体执行转移来捕获这些语义,无需预定义工作流图或离线训练,并利用学到的执行模型同时指导缓存逐出与主动预取,而不改变服务的关键路径。我们在vLLM之上实现了CacheScout。在代表性真实多智能体工作负载上,CacheScout将KV缓存命中率提高10-18个百分点,平均TTFT降低18-45%,平均每轮时延降低29-38%,峰值吞吐量最高提升57%。这些收益还能推广到更大模型:TTFT最高降低54%,同时保持高37%的吞吐量。
