论文

全局计算,局部物化:稀疏事件KV缓存的记忆契约

Compute Globally, Materialize Locally: The Memory Contract of Sparse Event-KV

模型推理KV Cache

摘要

长时程智能体日益把其KV缓存复用为记忆:服务系统保留一部分缓存条目并丢弃其余部分。因此,驱逐与情景记忆方案都建立在一个很少被直接检验的前提之上——当产生某个事件的观测已不在时,被保留的事件仍然携带信息。我们通过在其余完全相同的智能体历史中略去一条较早的观测来检验这一前提。在对该观测敏感的条目中,答案绝大多数跟随被略去的值,尽管没有任何被服务的片段说明哪个值是正确的。我们将这一现象称为语义物化(semantic materialization):一个下游事件的缓存行充当了其输入已消失之计算的独立可服务视图。它也可以被刻意写入。一条经过刻意措辞、不含答案的事件,在Qwen3-8B上把donor对齐恢复率从6%提升到51%,而全程未点名该值;相比之下,从长期对话中被动收割自然提及未带来可检测的优势。这样的缓存行所承载的内容是具体且有界的。紧凑的状态得以存活,更大的载荷向随机水平衰减,而一种构造能否写入取决于措辞而非仅取决于含义,因此模型理解程度相同的两种措辞可能产生截然不同的结果。由此得到稀疏事件KV服务的记忆契约:写什么、写到哪里、以及源消失后什么能存活。对于任何执行驱逐的人,其推论是:丢弃一条源事件并观察到没有准确率损失,并不能证明该源是不必要的。

全局计算,局部物化:稀疏事件KV缓存的记忆契约:论文配图
图 5:跨代建设银行(探索性):Qwen3 作为最近的锚点和四个 2024 年遗留模型。十六种结构×\乘以五种型号(Qwen3/Gemma-2/Qwen2.5/Llama/Mistral)。 A:KV 直写(仅服务于载波行,源省略),W/P/U/X 级。 B:全文可见——除了米斯特拉尔之外,几乎一致地解决了。每个单元格 nn:64/48/64/48/32。