论文
SCAN:面向终身知识编辑的稀疏电路锚定可解释神经元
SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing
摘要
大语言模型(LLM)在序列化知识编辑过程中常常遭受灾难性遗忘与模型崩溃。这一脆弱性源于当前主流的稠密编辑范式:它将模型视为黑箱,并依赖粗粒度的参数干预,从而不可避免地破坏已保留的知识。为解决这一问题,我们提出SCAN(基于稀疏电路锚定神经元的稀疏编辑框架),它通过稀疏转码器(Sparse Transcoders)构建知识电路,将编辑转化为机制感知的操作。在Gemma2、Qwen3和Llama3.1上跨CounterFact、ZsRE和WikiFactDiff的实验表明,SCAN取得了更优的性能,即使在3,000次序列编辑之后,仍能在MMLU和GSM8K等基准上保持模型完整性;而其他现有方法随着编辑不断累积而逐步退化,最终导致模型崩溃。
