论文
从事实覆写到知识演化:基于在线策略自蒸馏的因果编辑
From Fact Overwriting to Knowledge Evolution: Causal Editing via On-Policy Self-Distillation
摘要
尽管知识编辑(KE)能实现高效更新,其主流的静态事实覆写范式将LLM当作离散数据库,强行注入孤立的事实。这会割裂预训练的逻辑拓扑,引发认知失调(Epistemic Dissonance)——一种病理现象:未随之演化的旧有先验迫使模型显式否定被注入的更新。理想化干预揭示,这是一种固有的结构性缺陷而非单纯的算法噪声:一个零失真代理即导致高达95.6%的自我反驳率。鉴于现实世界知识的因果驱动本质,将更新锚定于显式的因果叙事可把这一冲突率有效压低至仅6.6%,凸显了向因果编辑(Causal Editing)范式转变的迫切性。为内化这种演化,我们提出CODE(Causal On-policy Distillation for Editing,面向编辑的因果在线策略蒸馏)。通过将因果自助法(causal bootstrapping)与非对称在线策略蒸馏相耦合,CODE将因果转移逻辑直接镌刻进参数记忆。在LLaMA-3.1和Qwen-2.5上的实验表明,CODE将自我反驳率大幅压至1.8%,同时保有稳健的多跳准确率(最高83.5%),将离散的事实注入无缝转变为连贯的知识演化。代码发布于 https://github.com/CrashBugger/CODE。
