论文

KVEraser:学习引导 KV 缓存以实现高效的本地化上下文擦除

KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

模型推理KV Cache

摘要

KV 缓存上的事后上下文擦除具有挑战性,因为本地编辑会产生全局后果:一旦处理了跨度,其影响就会传播到所有后续标记的缓存状态。此问题在长上下文 LLM 应用程序中自然出现,其中陈旧、不正确或有害的上下文只有在预填充后才能识别。然后,精确擦除必须重新计算删除范围后的所有词元,使其计算成本取决于后缀长度而不是擦除范围长度。我们介绍 KVEraser,一种用于高效本地化上下文擦除的学习 KV 缓存编辑方法。 KVEraser 用学习到的转向状态替换擦除间隔的 KV 状态,同时重新使用剩余的缓存不变。为了学习可转移擦除机制,我们使用两级管道:通用跨度邻居 预训练 后跟特定于任务的 微调。实验表明,KVEraser 在跨 1K-32K 上下文的域内任务的擦除后性能方面几乎与完全重新计算相匹配,而其延迟仅增加了 29.6%,而完全重新计算则增加了 17.6 倍。 KVEraser 还可以推广到具有有害事实干扰因素的看不见的长文档 QA,以及通过恶意技能文件注入进行工具选择,从而在近似基线中实现最佳性能,与完全重新计算相比,速度提高了 2.9-10.7 倍。值得注意的是,全参数擦除器训练是不必要的:16 级 LoRA 擦除器训练的参数数量仅为生成器的大约 0.6%,其性能与全参数擦除器相当或更好。