论文

隐藏而不删除:网络如何抑制纠缠特征

Hidden not Deleted: How Networks Suppress Entangled Features

模型评测模型行为与机制分析

摘要

通过线性投影操作的概念擦除方法假设特征占据可分离的子空间。我们证明这种假设在密集叠加下失败:当两个特征被迫进入共享单个子空间的对映对时,最先进的线性擦除会破坏两者,而不仅仅是目标。相反,使用梯度下降训练的网络非线性但不均匀地解决这个问题:它们根据初始化收敛到两个不同的电路级解决方案之一,我们称之为镜像和阴影解决方案。我们将这种分叉映射为特征纠缠的函数,表明它反映了稳定的吸引子结构而不是我们设置的伪影,并使用有针对性的因果干预来证明两种解决方案都留下了完整的、可测量的擦除特征表示痕迹,可通过单个标量补丁恢复,而不需要任何进一步的训练。这反映了最近在 LLM 遗忘中根据经验观察到的失败模式,其中抑制而不是删除允许遗忘的知识重新出现;我们的结果提供了一种机械的、经过因果验证的解释,解释了为什么会出现这种故障模式。