论文

遗忘的几何:时间知识漂移作为LLM表征中的独立轴

The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations

模型评测模型行为与机制分析

摘要

大语言模型肯定会产生过时的答案,并且现有的方法无法检测到它们。我们证明这不是工程失败,而是结构性失败:时间漂移,即存储的事实自训练以来是否发生变化,被编码为与正确性和不确定性几何正交的残差流中的方向。因此,任何对正确性或不确定性信号进行操作的方法都不会受到构造漂移的影响。我们通过六个指令调整模型验证了这一点。直接在漂移标签上训练的线性探针实现了 AUROC $0.83$--$0.95$;基于令牌熵、语义熵、CCS 和 SAPLMA 的方法都仍然接近机会 ($0.49$--$0.57$)。五项测试确认了几何正交性:权重余弦 ($|\cos| \leq 0.14$)、得分相关性 ($|r| \leq 0.20$)、双向零空间投影 ($|Δ| \leq 0.008$)、$k{=}10$ 的迭代零空间投影以及均值差解离。从机制上讲,MLP 检索电路对陈旧回忆和混淆产生相同的动态($r > 0.81$,六个模型),解释了为什么输出置信度无法将它们分开。交叉截止实验保持输入不变,仅改变模型:探测器触发其训练早于事实转变的模型,否则保持沉默($P(A{>}B) = 0.975$--$0.998$,十二个模型对),确认它读取模型内部知识状态而不是输入属性。我们的代码和数据集将公开发布。

遗忘的几何:时间知识漂移作为LLM表征中的独立轴:论文配图
图 2:沿着与正确性和不确定性几乎正交的轴对漂移进行解码(Mistral-7B、L6)。从每个分数解码 is_drifted 给出 AUROC 0.990.99(漂移)、0.710.71(正确性)、0.540.54(不确定性);只有漂移携带信号。正确性-不确定性相关性 (r=−0.24r\!=\!{-}0.24) 是非漂移轴之间的预期依赖性 (§5);漂移保持独立。