顺序知识编辑在不损失准确率的情况下破坏模型辨别好坏证据的能力
Sequential knowledge editing breaks a model's ability to tell good evidence from bad, without costing it accuracy
摘要
知识编辑的评测标准是:被编辑的事实是否改变、改写是否跟随、无关答案是否保持不动。一个模型可以通过全部三项,却仍然失去一项它们都未测量的能力:在从未被编辑的事实上判断该相信哪些检索文档。我们在编辑前后,固定查询、段落和两个候选字符串,对模型赋予其记忆答案相对于注入段落所断言答案的对数几率打分。我们最干净的实验臂是保守调优的LoRA:在Qwen2.5-7B-Instruct上进行1,000次顺序编辑后,它的MMLU在小数点后四位保持不变,然而仲裁量在未触及事实上的离散度下降36%。选择性预测随之退化。风险-覆盖曲线下面积上升0.107,而在相同MMLU下规范匹配的扰动仅为0.005;模型最有信心的四分之一仲裁决策上的错误率从0.217升至0.342。这不是能力损失。在五个严重程度上扫描随机扰动,把MMLU从0.6275砍到0.3725的损伤所产生的危害(0.088)反而小于MEMIT在0.6050时的危害(0.102)。该效应在三个种子、两个模型家族、两个数据集、两个探针不相交准则、三个提示模板和改写查询下均成立。对保存的权重增量的层消融显示其是分布式的:没有单层能复现它,移除任何一层约恢复一半。在冻结检索器的检索场景下,准确率从0.592降至0.46。一个次要发现在实践中可能更重要:我们运行的五个模型-方法配对中有三个,在公开超参数下进行1,000次顺序编辑后MMLU坍缩至随机水平,而编辑成功率保持1.00、局部性读数干净。从不测量能力的顺序编辑评测看不到这一点。
