论文

审计有限记忆语言模型中的遗忘

Auditing Forgetting in Limited Memory Language Models

模型评测评测方法与指标

摘要

有限记忆语言模型 (LMLM) 将事实知识外化到数据库中,以实现基于删除的忘却,而无需重新训练。现有的评估总体上衡量删除后的正确性,无法判断删除的事实是否通过残留参数记忆、替代检索路径或近邻检索工件而持续存在。我们提出了一个因果审计框架,该框架保持模型固定,并在推理时通过三种干预措施改变数据库状态:FULL、DEL-ON 和 DEL-OFF。该框架将删除后行为分解为参数泄漏 L(f)、检索介导的正确性 R(f) 和基于推理时间检索轨迹的检索伪影率。我们将其应用于 13 个数据库中的 12,228 个别名闭合删除,包括我们在三个域中构建的四种对抗性拓扑(基础、别名、噪声、冲突)和六种提示公式。在每个变体和每个提示样式中,参数泄漏都接近于零:在没有检索的情况下,模型很少返回已删除的答案。确实存在的残差存在于检索图中:检索介导的正确性和检索伪影率在各处舍入内匹配,因此在我们的审计中,删除后的正确性主要是从近邻检索中重建的。该残差范围从已发布的 LMLM 数据库的 0.7% 到最具对抗性变体的 13.6%,并且即时表述不能独立控制已删除事实的存活率。这些结果表明,对于此类 LMLM 和删除过程,遗忘边界主要是由数据库管理员而不是模型绘制的。