论文

AI 的真正长期记忆:比重新计算更快、更便宜的 5000 万token窗口

Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute

模型推理KV Cache

摘要

大型语言模型只能使用适合其上下文窗口的文本,并且每次发送提示时都会重新计算提示的内部键值 (KV) 状态。我们测试了一个内存层,即公共包 galahad-kv,它将大约 16,000 个token的每个块的 KV 状态保存到加密的本地 NVMe 磁盘,并在稍后将其精确字节加载回来,而无需重新计算。我们在 50,000,000 个真实公共文本的token上运行它,通过 vLLM 在一台 NVIDIA H100(使用 Gemma 4 12B 和 Gemma 4 31B)上提供服务。我们探测的每个块都从加密存储中加载回来,在两个模型上都无需重新计算(100 中的 100,深度从 0 到 50M token)。加载一个块比重新计算它快 2.8 倍到 4.3 倍,并且使用的 GPU 能量减少 8.8 倍到 12.3 倍,并且 GPU 内存在整个 50M token流上保持平稳。当被问及之前植入数百万token的事实时,12B 模型在 100 次中给出了 82 次正确答案,31B 模型在 100 次中给出了 98 次正确答案。这两个模型都没有给出答案。限制如下。这是存储状态的重用,而不是更广泛的关注窗口:加载一个块 一次,问题的回答效果取决于模型。写入内存是一次性成本,并且存储需要数 TB 的本地 NVMe 磁盘。我们描述了测试协议,该协议旨在抵制长上下文基准测试的常见游戏方式,并提供使用公共软件和软件包的免费许可证的单 GPU 再现。