论文
揭露LLM知识编辑中的擦除错觉
Exposing the Illusion of Erasure in Knowledge Editing for LLMs
摘要
知识编辑(KE)已成为无需昂贵的再培训即可更新 LLM 中特定事实的前沿,但其可靠性和底层机制仍知之甚少。在这项工作中,我们从对抗性启发的角度检查了 KE,揭示了编辑的知识通常没有完全删除并继续浮出水面,在不同的模型架构中观察到一致的失败。为了解释这种行为,我们对流行的 KE 方法进行了机械分析。我们表明,低秩更新不会覆盖现有知识,而是在模型的表示空间内重新分配它。此外,我们发现这些方法充当有针对性的抑制机制,降低了表达原始事实的可能性,而不是将它们从模型中删除。对损失情况的分析表明,经过编辑的知识位于狭窄的各向异性区域,这些区域对扰动高度敏感,使得它们极易受到间接提示和对抗性攻击。通过揭露这些深刻的架构漏洞,我们的工作证明了 KE 算法本质上是可绕过的,并促使我们对如何在多个 LLM 应用程序中部署事后更新进行根本性的重新评估。