论文
ALOE:用于知识编辑的语义寻址低秩算子
ALOE: Semantically Addressed Low-Rank Operators for Knowledge Editing
摘要
知识编辑通过修改参数改变模型所知,使被请求的事实更新而无关行为得以保留。这通常被视为写入问题,但编辑还涉及寻址问题:决定哪些隐藏状态应接收新的残差。激活过窄的更新只会记住一个提示,而激活过宽的更新会扰乱邻近知识。参数化编辑器隐式编码这一范围,而基于记忆的编辑器使选择显式但将其置于被编辑模型之外。我们提出ALOE(用于编辑的寻址低秩算子),它从改写和困难同主语负例中学习语义地址,通过rollout细化和门控校准将其与自回归隐藏状态对齐,并把得到的门控低秩算子嵌入单个MLP层,使部署后的模型在单次前向传播中运行,无需外部检索器或辅助路由器。在三个7—8B模型家族的CounterFact、ZSRE和KnowEdit上评测,ALOE的效力(efficacy)达0.955—0.999,局部性(locality)达0.981—1.000;机制分析确认学习到的几何结构能分离相互竞争的编辑,校准能抑制超范围激活。剩余误差集中在改写覆盖和写入拟合上。
