论文
现在正确,以后不足:审核上下文压缩中的更新充分性
Correct Now, Insufficient Later: Auditing Update Sufficiency in Context Compression
摘要
存储器可以正确回答当前查询,同时丢弃稍后更新所需的区别。我们通过配对历史审核来调查此失败:两个历史具有相同的当前答案,接收共享的未来更新,并且需要不同的后续答案。飞行员评估 6 个合成机制、12 个内存条件、2 个重复和两个模型后端的 24 个历史对。确定性前沿选择器在 DeepSeek 上获得严格的揭示精度 96/96,在 GLM 上获得 82/96 的严格揭示精度;结构化作家获得 62 次成功,其中一个未解决的结果为 56/96。配置的四结果联合对比的有限样本识别区间为[0.521,0.542]和[0.292,0.313],而不是置信区间。记录级审计可区分保留状态充分性、响应交付和答案模式合规性,而无需更改这些原始分数。它发现 26 和 25 个格式良好但语义结构错误的揭示记忆,而所有 14 个 GLM 前沿揭示失败都在错误的包装器中包含正确的值。删除墓碑会在目标机制中产生 16/16 的精确重放失败。然后,标识符重命名暴露了一个单独的缺陷:原始前沿后期引用充分性从 8/8 下降到 94/320 转换实例。我们提供并测试了标签等变修复,但它仅保留了 2/8 的原始后期引用答案:消除命名快捷方式并不能解决未知的未来相关性。这些结果支持范围评估方法和可重现的故障分析,而不是修复算法的总体优越性。付费试点证据、回顾性诊断和新的离线测试单独报告;没有声称进行独立的保留或自然任务验证。