论文
EngramEdit:通过条件记忆解耦大模型知识更新
EngramEdit: Decoupled Knowledge Updates in LLMs through Conditional Memory
摘要
DeepSeek Engram 等条件记忆架构使用输入 n-gram 来查找学习的嵌入,以有限的额外计算扩展大型语言模型 (LLM) 的容量。除了模型扩展之外,该架构还展示了将事实知识存储与通用计算分离的潜力,提供了一条在保持 Transformer 主干固定的同时更新事实知识的有前途的途径。实现这种潜力具有挑战性,因为事实的不同表达可能会激活不同的 n-gram 嵌入,而更新共享嵌入可能会无意中改变模型对其他事实的预测。我们提出 EngramEdit 通过条件记忆来解耦知识更新。 EngramEdit 首先计算目标记忆表示,使模型预测多个表达式中的更新事实。然后,它联合更新共享的 n-gram 嵌入,以在表达式和编辑中匹配这些目标,更强烈地惩罚对频繁重用嵌入的更新,以保留不相关的知识。实验 表明 EngramEdit 通过条件记忆实现独立事实知识更新,实现近乎完美的编辑成功。修订后的知识可用于未见过的表达和多跳推理,在思想链(CoT)提示下,其准确性几乎是最强基线的三倍。即使事实更新不断积累,不相关的知识和一般能力也会在很大程度上得到保留。这些发现表明,EngramEdit 将条件记忆转变为可编辑的知识界面,将其作用扩展到模型扩展之外,以支持解耦的知识更新。
