论文

EngramEdit:通过条件记忆解耦大模型知识更新

EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory

模型训练模型架构上下文与知识新型架构模型编辑与遗忘知识获取与更新

摘要

DeepSeek Engram 等条件记忆架构使用输入 n-gram 来查找学习的嵌入,以有限的额外计算扩展大型语言模型 (LLM) 的容量。除了模型扩展之外,该架构还展示了将事实知识存储与通用计算分离的潜力,提供了一条在保持 Transformer 主干固定的同时更新事实知识的有前途的途径。实现这种潜力具有挑战性,因为事实的不同表达可能会激活不同的 n-gram 嵌入,而更新共享嵌入可能会无意中改变模型对其他事实的预测。我们提出 EngramEdit 通过条件记忆来解耦知识更新。 EngramEdit 首先计算目标记忆表示,使模型预测多个表达式中的更新事实。然后,它联合更新共享的 n-gram 嵌入,以在表达式和编辑中匹配这些目标,更强烈地惩罚对频繁重用嵌入的更新,以保留不相关的知识。实验 表明 EngramEdit 通过条件记忆实现独立事实知识更新,实现近乎完美的编辑成功。修订后的知识可用于未见过的表达和多跳推理,在思想链(CoT)提示下,其准确性几乎是最强基线的三倍。即使事实更新不断积累,不相关的知识和一般能力也会在很大程度上得到保留。这些发现表明,EngramEdit 将条件记忆转变为可编辑的知识界面,将其作用扩展到模型扩展之外,以支持解耦的知识更新。

EngramEdit:通过条件记忆解耦大模型知识更新:论文原图
图 3:在 MQuAKE 上编辑结果。 (a) 标准(左)和 CoT(右)提示,置信区间为 95%。 (b) 按跳数划分的 CoT 准确度。 AdaL 和 MoE 表示 AdaLoRA 和 MoEEdit。