论文
面向代理式LLM服务的策略驱动运行时层
A Policy-Driven Runtime Layer for Agentic LLM Serving
摘要
多代理 LLM 系统已成为主导性的生产工作负载,但服务栈并非为它们而建。上层的代理框架知道代理身份、角色、schema 和分发结构,却从不接触引擎级事件;下层的服务引擎看到每一个事件,却对代理一无所知。数量惊人的横切策略同时依赖两者:前缀缓存、批次整形、投机执行、公平性、工具结果记忆化、安全执行等等。每一个都处在两层之间的缝隙中,目前靠向某一邻层打入一次性补丁来解决。我们认为,解决这一缝隙的最好方式是架构变革而非点状修补:在框架与引擎之间插入第三层——代理运行时层,暴露四个原语(observe、score、predict、act),任何代理感知策略都可以插入其中,并以代理身份作为共享坐标。我们把九种具体策略映射到该层上,并对其中最具直接服务成本杠杆的一项进行深入验证:跨会话的 KV 缓存,实例化为 CacheScout,它在线学习每个工作负载的代理转移矩阵,并将其用于基于存活的逐出和步间预取。在五个真实多代理工作负载上的初步结果显示,相比未经修改的服务栈,缓存命中率提升 13 到 37 个百分点,平均 TTFT 降低 12% 到 29%,吞吐量提高 6% 到 14%。