论文

KLOD:通过保持非目标分布实现局部性保持的知识编辑

KLOD: Locality-Preserving Knowledge Editing via Non-Target Distribution Preservation

模型训练模型编辑与遗忘

摘要

基于微调的知识编辑很简单且与体系结构无关,但标准交叉熵增加了编辑的目标概率,而无需明确约束非目标输出分布的变化。在顺序编辑中,这种不受约束的重新分布可能会累积为分布漂移并导致局部性退化。我们提出了 KLOD,这是一个有界且保持分布的目标,用于基于微调的知识编辑,它将预期的目标更新与应保持稳定的分布分开。一旦达到概率阈值,KLOD 就会停止目标放大,同时保留目标位置处排除目标的非目标分布以及前缀位置处的完整下一个词元分布。使用 Llama3-8B-Instruct 和 Qwen2.5-7B-Instruct 在 CounterFact 和 ZsRE 上进行的实验表明,KLOD 显着减轻了局部性退化,同时保持了高编辑可靠性。目标概率阈值进一步提供可控的泛化-局部性权衡。消融、多种子和分布式 KL 分析支持这样的解释:KLOD 的局部性增益与保留输出分布相关,而不是简单地削弱编辑。代码可在 GitHub https://github.com/Hostoday/KLOD 上获取。