论文

vToken:面向可回收KV缓存的token级虚拟化

vToken: Token-Level Virtualization for Reclaimable KV Caches

AI 基础设施推理服务

摘要

大语言模型服务面临关键内存瓶颈:KV缓存随序列长度与批大小增长。PagedAttention使用固定大小内存块以减少分配器层面的碎片,但近期的KV驱逐算法以比块级管理更细的token粒度运行。这种错配造成块内碎片,使已分配KV内存的很大一部分无法回收。我们提出vToken,一个轻量级token级虚拟化层,将逻辑token存活与物理块放置解耦。vToken通过token表间接寻址维护稳定的逻辑token视图,并通过异步重打包存活token实现物理回收。该设计保持PagedAttention内核与CUDA Graph的兼容性。我们在vLLM中实现vToken,并在多个模型上结合H2O、Random与Scissorhands进行评估。与成对对比的Naive-Evict基线相比,vToken将每请求保留的KV块减少27.2%–72.3%,并将SLA受限吞吐提升最高1.37倍。在受限活跃KV预算下,它将最大可行并发扩展至最高2倍,同时把每种策略的集成代码量从500多行降至50行以下。