论文

ATTUNER:通过查询端适配实现免重新计算的 KV 缓存重用

ATTUNER: Recomputation-Free KV Cache Reuse via Query-Side Adaptation

模型推理KV Cache

摘要

大语言模型 (LLM) Agent会重复将可重用内容(例如技能、文档和内存条目)加载到当前上下文中。为每个请求重新编码此内容会浪费计算。位置无关缓存 (PIC) 通过独立编码每个工件并在任意位置重用其键值 (KV) 状态来缓解这一问题,但相对于全上下文预填充,它会带来质量损失。现有方法通过恢复全局仓位 ID 或重新计算选定的词元来修复这种损失。在这项工作中,我们隔离了损失的来源,发现位置不匹配的影响较小,并且独立缓存的工件保留了忠实的表示:读取提供的工件在很大程度上保持准确,并且仅当模型必须在多个工件中进行选择时性能才会下降。此外,用全预填充分数替换 PIC 的注意力分数可以在缓存的 KV 不变的情况下恢复性能,将故障定位到注意力而不是 KV 重新计算。受此启发,我们提出了 \textsc{Attuner},一种查询端适应方法,可以学习读取冻结的工件缓存。 \textsc{Attuner} 将低秩适配器插入到查询投影中,并通过将完全预填充分布提取到学生中来进行训练。它训练少于 0.05% 的模型参数,并且在推理时既不需要缓存重新计算,也不需要完整上下文引用。在涵盖技能、文档、内存和代码的七个基准测试中的 Qwen3-4B 和 Qwen3-8B 上,\textsc{Attuner} 在域内和域外设置中都大大优于先前的 PIC 基线,匹配全上下文预填充质量,同时提供高达 $3.73\times$ 的加速。