论文

KVMem:在消费级 GPU 上虚拟化百万词元代理工作区

KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU

模型推理KV Cache

摘要

现代 LLM 代理在持久工作区中运行,其累积历史记录可能超过 GPU KV 容量和模型的本机上下文窗口。现有系统通常将较旧的上下文压缩为摘要或稍后将其作为文本检索,要么丢失细粒度的执行证据,要么重复预填充模型已处理的内容。我们提出了 KVMem,一个 KV 上下文虚拟化系统,它将溢出的工作空间历史记录保留为跨 GPU 内存、主机内存和 NVMe 的分页 KV 状态。 KVMem 使用轻量级的模型原生注意力空间索引来选择相关历史块,并具体化由模型原生上下文窗口界定的依赖于查询的执行视图。对跨历史记录高达一百万个 token 的长上下文代理基准(包括 LongMemEval、MemoryAgentBench 和 AgentLongBench)的广泛评估表明,与基于压缩的方法(处理上下文溢出的事实上的标准)相比,KVMem 通常可以实现更高的任务效用和更高的推理效率。在使用 Qwen3.8-27B 进行的 DeepSWE 长上下文测试中,KVMem 将任务成功率从仅压缩上下文管理的 43.8% 提高到 48.4%。在我们的本地部署评估中,KVMem 在配备 24GB RTX 5090 笔记本电脑 GPU 的现成笔记本电脑上运行带有 MTP 的 Qwen3.6/3.8-27B NVFP4,虚拟化最多 1M 词元的代理工作区,是模型本机 256K 词元上下文窗口的四倍。在单会话设置中,KVMem 每秒生成 $\sim$50 词元,为本地代理执行提供交互式响应。更广泛地说,通过将可寻址工作空间大小与 LLM 的本机上下文窗口解耦,KVMem 为长期运行的代理提供了一条实用的路径,这些代理的工作空间可以超出该窗口。