论文

意义的代价:为什么每个语义记忆系统都会遗忘

The Price of Meaning: Why Every Semantic Memory System Forgets

模型评测上下文与知识记忆模型行为与机制分析Agent记忆

摘要

当今生产环境中的每个主流AI记忆系统都按语义组织信息。这种组织方式支持泛化、类比与概念检索——但这是有代价的。我们证明,正是促成语义泛化的几何结构,使干扰、遗忘与虚假回忆不可避免。我们针对“语义连续核-阈值记忆”形式化这一权衡:即检索分数是具有有限局部内在维度的语义特征空间中内积的单调函数的系统。在该类系统中我们推导出四个结果:(1) 语义有用的表示具有有限有效秩;(2) 有限局部维度意味着检索邻域中存在正的竞争者质量;(3) 在记忆持续增长下,保持率衰减至零,并在幂律到达统计下产生幂律遗忘曲线;(4) 对满足δ-凸性条件的联想诱饵,无法通过调节阈值消除虚假回忆。我们在五种架构上检验这些预测:向量检索、图记忆、基于注意力的上下文、BM25文件系统检索和参数化记忆。纯语义系统直接以遗忘和虚假回忆的形式表现出这一脆弱性。推理增强系统部分掩盖这些症状,却把优雅退化转变为灾难性失败。完全摆脱干扰的系统则以牺牲语义泛化为代价。意义的代价是干扰,我们测试的所有架构都无法免于支付。

意义的代价:为什么每个语义记忆系统都会遗忘:论文配图
图 7:四种内存现象的架构比较。所有五种架构和人类参考的遗忘指数 bb、DRM 诱饵 FA、间距 Cohen dd 和 TOT 率的热图。三个原型行为类别是可见的:纯几何(顶部两行)、推理覆盖(中间)、违反 SPP(底部)。破折号表示该架构无法测量的指标(注意 bb:sigmoid,不是幂律;参数间距:无受控范式)。 †参数化 TOT (69%69\%) 使用与人类/嵌入 TOT 不同的操作定义,并且不具有直接可比性(请参阅讨论)。指标是特定于体系结构的,并非所有指标都可以直接在数值上进行比较(请参阅协议差异的方法)。