论文

ReCache:工具增强型 LLM 代理的高效 KV 缓存重用和压缩

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

模型推理KV Cache

摘要

代理语言模型重复编码在不同组合和顺序的请求中重复出现的工具和技能模式,从而防止标准前缀缓存重用其键值 (KV) 状态。我们引入了 \textbf{ReCache},一个用于独立缓存资源表示的框架,同时减少其推理时间计算和内存开销。资源明智的注意力消除了跨资源交互并分配资源本地位置,产生组合不变的 KV 块。然后,ReCache 将资源可见性限制为贡献选择层 - KV 头组路由,并通过结构和语义修剪仅保留调用关键字段。我们根据七个公共工具和技能使用数据集(包括资源不相交测试)组装的基准来评估 ReCache。资源方面的注意力与密集调用性能相匹配(82.3\% vs 82.4\% Inv-F1),同时提供 3.655$\times$ 的首次标记时间加速。完整的框架将分配的 KV 张量内存减少了 92.43%,并将注意力加速了 1.423$\times$。这些结果表明,将可重用模式编码与选择性资源访问分开可以显着降低代理推理成本,并且有效性损失有限。代码可在 https://github.com/EIT-NLP/ReCache 获取。