论文
知识包:通过 KV 缓存注入进行零词元知识传递
Knowledge Packs: Zero-Token Knowledge Delivery via KV Cache Injection
摘要
RAG 浪费词元。我们提出知识包:预先计算的 KV 缓存,以零词元成本提供相同的知识。对于因果 Transformer,文本 F 上的正向传递的 KV 缓存与 F+q 上的联合传递所产生的 KV 缓存相同 - 这直接来自因果掩码。等价性是精确但脆弱的:错误的聊天模板格式会导致 6-7pp 性能下降,我们相信这解释了先前关于 KV 优于 RAG 的说法。通过正确的格式:Qwen3-8B 和 Llama-3.1-8B 上的 700 个问题零分歧,最多可节省 95% 的词元。 KV 接口还可以实现 RAG 无法做到的行为引导。由于 RoPE 会轮换密钥但不影响值,因此缓存值的对比增量可以推动模型行为,而密钥算术会破坏一致性。效果位于中间层值 (33-66%),独立方向几乎正交 (cos~0) 和组合,两个通道(知识和转向)在 alpha<=0.7 下同时运行,不会产生干扰。无需训练,无需调整权重。