论文

具有特定于层的本地历史记录的共享全局 KV

Shared Global KV with Layer-Specific Local History

模型推理KV Cache

摘要

仅解码器 Transformer 语言模型缓存键和值 (KV),以便在生成过程中重用过去的计算。跨层共享 KV 可以节省存储空间,但会减少跨深度可用表示的多样性。我们研究本地内存应该与共享全局 KV 一起保留哪些内容,将历史内容与用于形成它的输入源分开。在 126M 参数和 2K 上下文中,一项八种子研究发现,与当前词元本地分支相比,本地历史的保留测试困惑度降低了约 1.4%。容量、条目计数和训练计算控制支持历史内容的价值。在两种子比较中,当相邻层共享本地输入同时保留独立投影时,该值仍然存在;源共享还缩短了缓存构建的确切依赖关系。相对于 GQA 和相邻层 KV 共享,相等有界学习率搜索和新种子确认可以通过更大的缓存和更高的长请求延迟产生更好的同源可能性。在等词元适应 8K 后,针对相邻层共享的排序仍然存在,且上下文成本较短。八种子外部书历史效应仍然不确定,下游结果因任务而异。我们得出了一个足够的后缀调度,可以减少上层的构建工作,同时以精确的算术保留完整的缓存。