论文
PTStore(Prefix Tensor Store):面向高吞吐推理服务的分布式前缀缓存与复制
PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving
摘要
受内容分发网络(CDN)客户端缓存设计的启发,PTStore对构成可复用KV缓存前缀的热门张量进行分布式存储与复制,而这正是最先进方法加速推理所采用的主要技术。这降低了访问KV缓存的延迟,并缓解了含有热门张量的服务器因请求数量过多而造成的负载不均衡。此外,得益于去中心化,PTStore能将用于LLM推理的KV缓存规模扩大数个数量级。因此,在长文档问答数据集上,PTStore执行推理的效率比当前基线高5-6倍,后者不聚合跨节点与GPU的内存,因而需要重新生成KV缓存。
