论文
被抑制而非抹除:无权重知识编辑后旧事实仍留有表征痕迹
Suppressed, Not Erased: A Representational Trace of Edited Facts Survives Even Weight-Free Knowledge Editing
摘要
知识编辑基准确认的是局部正确性,即编辑后的模型能否在编辑附近提示上生成新事实,却不衡量原始事实有多少仍可在模型内部解码。我们用线性痕迹探针直接研究残余知识:编辑事实后,原始对象是否仍能从模型隐藏状态恢复?在GPT-2-XL上,对50项CounterFact编辑使用三种机制不同的编辑器后,即使编辑成功,原始对象仍可被线性解码,明显高于随机水平:ROME探针准确率为0.96,受约束微调为0.86,基于记忆的GRACE为0.79,随机水平为0.50;所有编辑的生成成功率均为100%。GRACE结果最具说明力:它完全不改变基础模型权重,而通过外部记忆覆盖事实,但原对象仍可从底层网络解码,因此残留痕迹不能归因于权重更新不彻底。我们据此认为,即使编辑在行为上成功,也更像在表征空间抑制而非擦除原始关联。我们还报告一种在本设置中表现不可靠的再学习节省测量工具,并讨论原因;我们把它视为负面方法学结果,而非证据。代码与数据已发布。
