论文
通过张量结构更新对混合专家 LLM 进行可扩展的知识编辑
Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates
摘要
知识编辑 (KE) 提供了 LLM 的重复 微调 的轻量级替代方案。然而,大多数现有的 KE 方法都针对密集的前馈层,而现代 LLM 越来越多地采用专家混合 (MoE) 架构,以实现卓越的内存占用和推理效率。这种不匹配导致越来越多的生产模型缺乏原则性的编辑工具。我们提出了一个类似 MEMIT 的框架,用于基于 MoE 的 LLM 中的知识编辑。我们的方法利用 MoE 层的张量结构在每个专家级别忠实地制定编辑目标,并应用 Woodbury 矩阵恒等式来避免具体化或反转专家权重的完整堆叠矩阵。由此产生的更新减少为固定低秩矩阵的逆,并且不需要额外的向后传递。根据经验,我们的方法与主要 KE 指标的强基线的编辑质量相匹配,同时由于批量 MEMIT 式公式和 Woodbury 恒等式实现的低维反转,将编辑过程加速了高达 6 倍。这些结果表明,封闭形式的参数修改 KE 可以有效地扩展到密集层之外,从而为现代稀疏 LLM 架构中的可扩展知识编辑开辟了道路。