论文

SCAN:面向终身知识编辑的稀疏电路锚定可解释神经元

SCAN: Sparse Circuit Anchor Interpretable Neuron for Lifelong Knowledge Editing

模型训练模型编辑与遗忘

摘要

大语言模型(LLM)在序列化知识编辑过程中常常遭受灾难性遗忘与模型崩溃。这一脆弱性源于当前主流的稠密编辑范式:它将模型视为黑箱,并依赖粗粒度的参数干预,从而不可避免地破坏已保留的知识。为解决这一问题,我们提出SCAN(基于稀疏电路锚定神经元的稀疏编辑框架),它通过稀疏转码器(Sparse Transcoders)构建知识电路,将编辑转化为机制感知的操作。在Gemma2、Qwen3和Llama3.1上跨CounterFact、ZsRE和WikiFactDiff的实验表明,SCAN取得了更优的性能,即使在3,000次序列编辑之后,仍能在MMLU和GSM8K等基准上保持模型完整性;而其他现有方法随着编辑不断累积而逐步退化,最终导致模型崩溃。

SCAN:面向终身知识编辑的稀疏电路锚定可解释神经元:论文配图
图1:方法对比:现有知识编辑修改整个稠密MLP权重矩阵,SCAN则定位事实特征,仅编辑与知识相关的向量,实现终身编辑。