论文

掩蔽扩散语言模型的知识编辑

Knowledge Editing for Masked Diffusion Language Models

模型训练模型编辑与遗忘

摘要

知识编辑旨在更新或纠正语言模型中的事实知识。一种广泛使用的方法是“定位然后编辑”,首先在模型中定位事实,然后编辑其中的权重。迄今为止,此类方法是专门为自回归模型(ARM)开发的。它们是否适用于双向模型文本并通过迭代去噪而不是下一个标记预测生成的掩蔽扩散模型(MDM)仍然是一个悬而未决的问题。我们通过将定位然后编辑转移到 MDM 并将多个 MDM 与其匹配的 ARM 进行比较来解决这个问题。我们的中心发现有两个部分。首先,应在它们之间应用编辑的地方进行传输:最后一个主题标记处的相同早期到中层 MLP 对两者都是最有效的。其次,这种共同的位置并不能保证共同的结果。单标记编辑在两者中都取得了成功,但随着目标变长,MDM 中的编辑性能比 ARM 中的退化要严重得多。失败源于编辑事实的生成方式:生成多词元目标会经历中间状态,其中目标部分未被屏蔽,而编辑从未针对该状态进行优化。在此诊断的指导下,我们引入了一个简单的修正,可以优化包括此类状态的编辑,从而显着恢复多词元性能。我们的代码可在 https://github.com/holi-lab/MDM-KE 获取。