论文

低延迟多代理工具调用的状态推理

Stateful Inference for Low-Latency Multi-Agent Tool Calling

AI 基础设施推理服务

摘要

多代理工具调用正在成为基于 LLM 的系统的主要交互模式,但现有的推理框架将每个工具调用视为一个独立的请求,从头开始重新处理整个对话,即使 85-95% 的提示与上一回合相比没有变化。我们提出了一种状态推理架构,它将传统服务的每回合成本转换为 $O(Δ_t)$ 增量成本:持久的 KV 缓存通过仅摄取新词元来跨回合和前进,而基数前缀缓存将其扩展到交错的多代理流量,提示查找推测解码器可加速结构化输出。与新颖的、完全生成的工作负载上的 vLLM 和 SGLang 相比,参考实现在 6 回合代理工作流程中每回合快了 2.1\times$,在 35 回合代理工作流程的中值回合中快了 $4.2\times$,将端到端的挂起时间减半。优点来自有状态的重用和推测,而不是缓存。