论文
异构注意力记忆的运行时可观测性
Runtime Observability for Heterogeneous Attention Memory
摘要
现代模型不再使用简单的KV缓存:潜在缓存、学习得到的稀疏选择器和循环状态以不同形式保存记忆,压缩时也会以不同方式失效。我们提出了一种运行时可观察性契约,覆盖所有四类内存,并用三种操作符实现,然后在五种架构家族中的六种模型配置上实例化该契约,并将每阶段的边界量化为执行请求级别的风险记账。契约以类型作为错误度量,只有当度量匹配时才定义组合,这一检查拒绝了作者最初的组合链;修复后的组合链,通过两个已证明的桥梁跨越了度量,然后不管任何无法由形式系统验证的内容都被测量,最终将组合层降到了实证自动决策:每项声明被划为已认证、部分认证或经验性,组合继承最弱的层次,并由机器决定。在1240万个读取操作和八个并发请求预算下运行,且在身份归属失败时拒绝执行,记账量化了今天的见证中的诚实交易风险,并保持零违规。一个融合的始终在线探针观察到CUDA图中的声明一层子集,应用于一个装有压缩KV原型的Served DeepSeek-V4栈,同样的机制将隐蔽的错误定位到精确的结构边界——在无缓存逐出且身份隔离的情况下定位精确;观测到的失效均发生在缓存逐出或槽位复用条件下,通过机器裁定的区分实验,我们的两个混淆推理被拒绝。所有文件、保护措施和Lean开发都在https://github.com/metask-ai/witprobe-attention-memory上发布;本文中的每个数字都从发行版文件中生成。