探针几何对齐:消除偶然的交叉序列记忆签名
Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance
摘要
最近的攻击表明,大语言模型 的行为遗忘会留下可通过对抗性探针恢复的内部痕迹。我们描述了这种保留的位置,并表明可以通过手术将其移除,而无需可测量的能力成本。我们的中心协议是留一交叉序列探针,用于测试记忆签名是否可以跨保留序列进行泛化。签名是真实且跨尺度一致的:Pythia-70M、GPT-2 介质和 Mistral-7B 上的特定记忆差距为 +0.32、+0.19、+0.30;在 Pythia-70M 上,随机初始化控制在预训练签名达到峰值的最深层崩溃至 -0.04。探测方向与回忆在因果上是分开的——将其投射出来会导致局部签名崩溃(+0.44 -> -0.19),而行为回忆几乎没有变化——并且在自然记忆内容上训练的探测不会对 微调 注入的秘密进行分类,从而标记出两种代表性不同的机制。然后,我们引入探针几何对齐(PGA),这是一种外科手术擦除,可以沿着探针的实时读出方向在每个深度对齐激活。 PGA 在所有四个测试尺度上驱动交叉序列探针低于随机概率(玩具深度 4:0.17;Pythia-70M:0.07;Mistral-7B:0.45;GPT-2 介质:MD-PGA k=2 的 0.06),并且对六种对抗性探针变体保持稳健。针对在 PGA 处理的激活上训练新探针的重新拟合攻击者,我们对抗性地扩展了 PGA,在每个与记忆相关的深度击败重新拟合探针,同时将每个任务的 5 个零样本能力基准保持在 2.8 个百分点以内(平均 Δacc = +0.2pp)。跨序列签名是预训练表示的真实的、因果可分离的、制度特定的属性——可以通过每个深度的单一一级干预来去除,而无需可测量的能力成本。