论文
正确答案,错误机制:检测因果干预中的有害分歧
Right Answer, Wrong Mechanism: Detecting Pernicious Divergence in Causal Interventions
摘要
诸如激活修补和分布式对齐搜索(DAS)之类的因果干预是对神经网络提出机械论的主要工具。最近的研究表明,这些干预措施通常会将表征推离模型的自然分布,并且这种差异有时是无害的,有时是有害的:它可以招募模型从未在自然输入上使用的路径,从而使干预通过错误的机制产生预期的答案。目前还没有方法可以区分这两种情况。我们通过在预训练的语言模型中植入隐藏的路径来使这个问题变得可测试;这些路径对构建所提示的每个基准都保持沉默,因此可以准确地知道哪些干预措施依赖于它们。在 GPT-2 Small 上的 72 个配置和 100,800 次干预中,我们发现了三件事。 (i) 在之前的工作中使用的干预地点的最近邻距离和本地 PCA 距离在挑选通过种植路径给出正确答案的干预措施时得分低于机会 (AUROC 0.35-0.47)。 (ii) 隐藏路径贡献 (HPC),一种无标签测试,将下游单元限制在具有相同输出的自然运行机制中,并测量有多少决策消失,当路径显示为单元级的系统外活动时,用 AUROC >= 0.99 标记路径主导的干预措施,但当每个单元保持在其自然范围内时失败,我们将其识别为开放问题。 (iii) 优化干预措施积极寻求隐藏途径:在性别任务中,DAS 90-95% 的成功率是通过为四个家庭中的三个设定的途径实现的,下游的流形惩罚将这一比例降低到 5% 以下,成功率降低了 6-11 个百分点。在未经修改的 GPT-2 中,成功的干预几乎没有表现出单位级别的体制外依赖。