论文

何时遗忘:一种记忆治理原语

When to Forget: A Memory Governance Primitive

上下文与知识记忆Agent记忆

摘要

智能体记忆系统不断积累经验,但目前缺乏一个有原则的操作性指标来支撑记忆质量治理——即在智能体任务分布漂移时决定哪些记忆应被信任、抑制或弃用。写入时的重要性分数是静态的;动态管理系统依赖LLM判断或结构性启发式,而非结果反馈。本文提出记忆价值(Memory Worth, MW):一种每条记忆使用两个计数器的信号,追踪某条记忆与成功结果和失败结果共现的频率,为过期检测、检索抑制与弃用决策提供轻量且有理论依据的基础。我们证明,在满足最小探索条件的平稳检索机制下,MW几乎必然收敛到条件成功概率 p+(m) = Pr[y_t = +1 | m in M_t],即在记忆m被检索的条件下任务成功的概率。重要的是,p+(m)是一个关联量而非因果量:它度量的是结果的共现,而非因果贡献。我们论证这仍是记忆治理中一个有用的操作性信号,并在真实效用已知的受控合成环境中进行了实证验证:经过10,000个回合,在20个独立种子上,Memory Worth与真实效用之间的Spearman秩相关达到 rho = 0.89 ± 0.02,而从不更新评估的系统仅为 rho = 0.00。一项使用真实文本与神经嵌入检索(all-MiniLM-L6-v2)的贴近真实检索的微型实验进一步显示,在3,000个回合中,过期记忆跌破低价值阈值(MW = 0.17),而专业记忆保持高价值(MW = 0.77)。该估计器每条记忆单元只需两个标量计数器,可添加到已记录检索与回合结果的架构中。

何时遗忘:一种记忆治理原语:论文配图
图 1:各片段的记忆价值校准。对于所有四种加权策略,MWT​(m)\mathrm{MW}_{T}(m) 和 U*​(m)U^{*}(m) 之间的 Spearman ρ\rho,对 20 个种子进行平均(阴影区域:±\pm1 std)。无反馈基线始终保持在 ρ=0\rho=0。到第 10,000 集时,所有三种更新策略都收敛到 ρ≈0.89\rho\approx 0.89。