论文
遗忘的几何:时间知识漂移作为LLM表征中的独立轴
The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations
摘要
大语言模型肯定会产生过时的答案,并且现有的方法无法检测到它们。我们证明这不是工程失败,而是结构性失败:时间漂移,即存储的事实自训练以来是否发生变化,被编码为与正确性和不确定性几何正交的残差流中的方向。因此,任何对正确性或不确定性信号进行操作的方法都不会受到构造漂移的影响。我们通过六个指令调整模型验证了这一点。直接在漂移标签上训练的线性探针实现了 AUROC $0.83$--$0.95$;基于令牌熵、语义熵、CCS 和 SAPLMA 的方法都仍然接近机会 ($0.49$--$0.57$)。五项测试确认了几何正交性:权重余弦 ($|\cos| \leq 0.14$)、得分相关性 ($|r| \leq 0.20$)、双向零空间投影 ($|Δ| \leq 0.008$)、$k{=}10$ 的迭代零空间投影以及均值差解离。从机制上讲,MLP 检索电路对陈旧回忆和混淆产生相同的动态($r > 0.81$,六个模型),解释了为什么输出置信度无法将它们分开。交叉截止实验保持输入不变,仅改变模型:探测器触发其训练早于事实转变的模型,否则保持沉默($P(A{>}B) = 0.975$--$0.998$,十二个模型对),确认它读取模型内部知识状态而不是输入属性。我们的代码和数据集将公开发布。
