论文

KV 缓存的自适应过滤:诊断和纠正 LLM 推理中的结构角色偏差

Adaptive Filtering of the KV Cache: Diagnosing and Correcting Structural-Role Bias in LLM Inference

模型推理KV Cache

摘要

基于注意力的 KV 缓存驱逐(H2O 及其后代)通过对积累的注意力质量(此处被视为信号能量)并保持最重的词元进行排序来压缩长上下文模型的内存受限状态。在模式密集的输入流(例如嵌套 JSON)上,此分数充当不成比例地保留噪声的非平稳过滤器:非内容接收器角色(分隔符或空格)比任何内容角色携带的能量多一个数量级,并且结构 KEY 标记以大约 1.8 倍于携带答案的 VALUE 标记的速率过度保留,在 5% 的预算下将精确匹配精度从 88% 降至 0%随着保留状态的信噪比降低。反事实实验表明,抑制 KEY 词元是最好的可部署过滤器。我们对 SnapKV 的窗口分数进行无再训练、角色条件分配,由单个调整的超参数控制,在低于 20% 的预算下缩小了 63-98% 的 H2O 差距,并且在较高的预算下,适度匹配或超过全缓存精度 - 一个小的、种子敏感的去噪效果(在 B=0.50 时临界显着;在四个种子上,在 B=0.30 时无法与零区分)。 15 MB 线性角色探针以可忽略不计的推理成本提供这些标签,但匹配解析器级别的下游精度仍然存在。