论文

大语言模型 中规则级知识的分布式多层编辑

Distributed Multi-Layer Editing for Rule-Level Knowledge in Large Language Models

模型训练模型编辑与遗忘

摘要

大语言模型 不仅存储孤立的事实,还存储支持跨符号表达式、自然语言解释和具体实例进行推理的规则。然而,大多数模型编辑方法都是针对事实级知识而构建的,假设可以通过本地化干预来实现目标编辑。这一假设不适用于规则级知识,其中单个规则必须在多个相互依赖的形式中保持一致。我们通过规则级知识编辑的机制研究来研究这个问题。为了支持这项研究,我们将 RuleEdit 基准从 80 条扩展到 200 条手动验证的数学和物理规则。细粒度的因果追踪揭示了 Transformer 层中规则知识的特定形式的组织:公式和描述集中在较早的层中,而实例与中间层更相关。这些结果表明,规则知识不是统一本地化的,因此不能通过单层或连续块干预进行可靠的编辑。基于这一见解,我们提出了分布式多层编辑(DMLE),它将共享的早期层更新应用于公式和描述,并将单独的中间层更新应用于实例。在保持标准编辑指标竞争力的同时,DMLE 实现了更强的规则级编辑性能。平均而言,与 GPT-J-6B、Qwen2.5-7B、Qwen2-7B 和 LLaMA-3-8B 的最强基线相比,它将实例可移植性和规则理解分别提高了 13.91 和 50.19 个百分点。该代码可在 https://github.com/Pepper66/DMLE 获取。