论文
从神经网络中定向恢复权重空间机制
Targeted Recovery of Weight-Space Mechanisms From Neural Networks
摘要
参数分解 (PD) 将神经网络分解为可解释的计算组件,忠实地反映原始网络的操作。然而,将 PD 扩展到大型模型需要大量计算,这使其成为一项成本高昂且风险巨大的工作。在这里,我们提出了有针对性的 PD (tPD),它通过引入处理所有非目标数据的高级包罗万象的组件,仅识别处理感兴趣的特定输入的组件 - 从孤立的提示到大型子任务。我们在玩具模型和在 The Pile 上训练的 Transformer 语言模型上验证 tPD,它恢复了可重复的、机械上可靠的电路。我们使用其已发布分解的 7% 的 FLOP 提取 4 块 Transformer 的纯 CSS 子模型,在 12 块 Transformer 中,我们通过外科手术消除并重新连接记忆序列,对其他输入的副作用可以忽略不计。