论文

PTStore(Prefix Tensor Store):面向高吞吐推理服务的分布式前缀缓存与复制

PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving

模型推理KV Cache

摘要

受内容分发网络(CDN)客户端缓存设计的启发,PTStore对构成可复用KV缓存前缀的热门张量进行分布式存储与复制,而这正是最先进方法加速推理所采用的主要技术。这降低了访问KV缓存的延迟,并缓解了含有热门张量的服务器因请求数量过多而造成的负载不均衡。此外,得益于去中心化,PTStore能将用于LLM推理的KV缓存规模扩大数个数量级。因此,在长文档问答数据集上,PTStore执行推理的效率比当前基线高5-6倍,后者不聚合跨节点与GPU的内存,因而需要重新生成KV缓存。

PTStore(Prefix Tensor Store):面向高吞吐推理服务的分布式前缀缓存与复制:论文配图
图 1:LLM 推理的共享 KV 缓存概述。多个变压器块访问 KV 缓存以增量存储和重用 KV 结果。 KV 缓存可以由多个 LLM 实例共享,以利用共享前缀。