论文
Moir:让模型讲述自己的故事,实现强大的跨领域知识编辑
Moir: Let the Model Direct Its Own Story for Robust Cross-Domain Knowledge Editing
摘要
尽管语言模型仍停留在训练状态,但世界却在不断发展。知识编辑已成为全面再训练的关键替代方案,但其部署因核心能力的侵蚀而受到瓶颈:数学和程序推理崩溃,而百科全书般的回忆却完好无损。我们将这种不对称退化追溯到分布不匹配。基于协方差的编辑器仅保留参考语料库跨越的子空间,但无法捕获由 后训练 形成的操作分布,例如 SFT 和 DPO。静态外部语料库,包括维基百科,甚至原始的预训练混合物,都无法恢复这种移动的流形。我们提出了 Moir,它通过从模型自身的解码分布中采样,直接从模型本身估计保存协方差 $C$。使用单个随机词汇标记进行种子生成绕过了指令跟踪模板,否则这些模板将主导采样输出,从而暴露出模型内化的更广泛的子空间。 Moir 不需要外部数据,并且可以作为任何基于协方差的编辑器的插入组件,考虑到大多数现代 LLM 的前语料库和 后训练 语料库不可公开访问,这是一个实际优势。在 OLMo-2、Llama-3.1 和 Qwen-3 (7-8B) 中,在 MEMIT 和 AlphaEdit 下以及批量和顺序机制下,Moir 始终在最脆弱的域中扩展保留,最引人注目的是在 Qwen3-8B 上经过 20,000 次 AlphaEdit 批量编辑后,它保留了 79.9% 的 GSM8K 准确率,而维基百科基线的准确率为 10.9%。这些结果表明,将保存分布与模型的操作分布保持一致是非破坏性编辑的关键因素,并且模型本身可能是已部署系统最容易访问的分布来源。