论文

从事实覆写到知识演化:基于在线策略自蒸馏的因果编辑

From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation

模型训练模型编辑与遗忘

摘要

尽管知识编辑(KE)能实现高效更新,其主流的静态事实覆写范式将LLM当作离散数据库,强行注入孤立的事实。这会割裂预训练的逻辑拓扑,引发认知失调(Epistemic Dissonance)——一种病理现象:未随之演化的旧有先验迫使模型显式否定被注入的更新。理想化干预揭示,这是一种固有的结构性缺陷而非单纯的算法噪声:一个零失真代理即导致高达95.6%的自我反驳率。鉴于现实世界知识的因果驱动本质,将更新锚定于显式的因果叙事可把这一冲突率有效压低至仅6.6%,凸显了向因果编辑(Causal Editing)范式转变的迫切性。为内化这种演化,我们提出CODE(Causal On-policy Distillation for Editing,面向编辑的因果在线策略蒸馏)。通过将因果自助法(causal bootstrapping)与非对称在线策略蒸馏相耦合,CODE将因果转移逻辑直接镌刻进参数记忆。在LLaMA-3.1和Qwen-2.5上的实验表明,CODE将自我反驳率大幅压至1.8%,同时保有稳健的多跳准确率(最高83.5%),将离散的事实注入无缝转变为连贯的知识演化。代码发布于 https://github.com/CrashBugger/CODE。

从事实覆写到知识演化:基于在线策略自蒸馏的因果编辑:论文配图
图 1:静态事实覆盖中的认知失调。编辑后的模型(LLaMA-3.1-8B,通过 AlphaEdit)最初检索注入的目标(绿色)。然而,共同激活的遗留先验(蓝色)立即压倒了更新,迫使模型明确否定自己的主张并恢复到过时的答案(红色)。