论文

AnchorKV:通过带有拒绝锚点的软惩罚进行安全感知的 KV 缓存压缩

AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

模型推理KV Cache

摘要

大语言模型 (LLM) 在生成推理和长上下文任务方面优于早期架构,但其大尺寸在内存使用、能源成本和设备部署方面带来了重大挑战。由于扩展预训练语言模型可以提高下游能力 \cite{zhao2023survey},因此键值 (KV) 缓存成为主要的推理瓶颈。最近的 KV 缓存压缩方法 \cite{jo2025fastkv,li2024snapkv,zhou2024dynamickv} 通过仅保留与注意力相关的词元的子集来降低此成本。然而,虽然这些方法保留了良性工作负载的准确性,但它们的压缩策略要么无法防御越狱攻击\cite{jian2024robustkv},要么在激进驱逐下降低安全对齐。我们提出了 AnchorKV,这是对 KV 缓存压缩的一种直接修改,可以使词元保留分数偏离与有害提示相关的关键空间方向。 AnchorKV 通过将均值差异表示工程方法 \cite{arditi2024refusal,zou2023representation} 应用于 KV 缓存中使用的特定于层的密钥投影空间来构造离线安全锚。基于这个锚点,软惩罚词元选择规则用少量的效用来换取显着改进的安全对齐,同时当惩罚为零时减少到原始压缩器。