论文

通过门控奇异向量收缩进行选择性知识编辑逆转

Selective Knowledge Edit Reversal via Gated Singular Vector Shrinkage

模型训练模型编辑与遗忘

摘要

知识编辑提供了更新大语言模型中事实知识的有效方法。然而,恶意编辑可能会带来安全风险,因此有必要扭转不良的编辑效果。现有的参数修改编辑的反转方法主要集中于全局删除,这也可能删除应保留的有益编辑。在本文中,我们研究了编辑知识的选择性逆转,其目标是逆转有针对性的编辑事实,同时保留剩余的编辑事实。基于每次编辑都在编辑矩阵的主导子空间内稀疏编码的假设,我们提出了一种基于谱的反转框架,该框架将编辑敏感组件定位在编辑权重的主导奇异子空间内。跨多个设置的实验证明了我们的方法在反转所选编辑同时保留不相关的编辑事实方面的有效性。这些结果表明,不同的编辑在主要奇异成分中稀疏编码,并且当编辑数量适中时可以分离,这使得选择性谱反转成为定位编辑特定成分和修复编辑语言模型的有希望的方向。