论文

ALOE:用于知识编辑的语义寻址低秩算子

ALOE: Semantically Addressed Low-Rank Operators for Knowledge Editing

模型训练模型编辑与遗忘

摘要

知识编辑通过修改参数改变模型所知,使被请求的事实更新而无关行为得以保留。这通常被视为写入问题,但编辑还涉及寻址问题:决定哪些隐藏状态应接收新的残差。激活过窄的更新只会记住一个提示,而激活过宽的更新会扰乱邻近知识。参数化编辑器隐式编码这一范围,而基于记忆的编辑器使选择显式但将其置于被编辑模型之外。我们提出ALOE(用于编辑的寻址低秩算子),它从改写和困难同主语负例中学习语义地址,通过rollout细化和门控校准将其与自回归隐藏状态对齐,并把得到的门控低秩算子嵌入单个MLP层,使部署后的模型在单次前向传播中运行,无需外部检索器或辅助路由器。在三个7—8B模型家族的CounterFact、ZSRE和KnowEdit上评测,ALOE的效力(efficacy)达0.955—0.999,局部性(locality)达0.981—1.000;机制分析确认学习到的几何结构能分离相互竞争的编辑,校准能抑制超范围激活。剩余误差集中在改写覆盖和写入拟合上。

ALOE:用于知识编辑的语义寻址低秩算子:论文配图
图 3:对 Llama-3.1-8B-Instruct 进行 839 次 CounterFact 编辑后的运行时行为。(a) 编辑与改写的匹配槽位门控值,以及局部性查询的最大门控值。(b) 前 32 个采样查询对其关联槽位的响应。(c) 共享 PCA 下的成对末端块局部性状态,附经验边际分布与全范围插图。PC1/PC2 分别解释 45.1%/10.7% 的方差;平均相对状态漂移为 11.54%,下一 token 一致率为 96.5%。