论文
忠实性 到拒绝:神经元选择器的因果审计
Faithfulness to Refusal: A Causal Audit of Neuron Selectors
摘要
归因分数越来越多地识别语言模型的哪些神经元行对于剪枝、可解释性和安全编辑等应用很重要,但它们是否识别因果重要的行很少被直接测试。我们通过基于一次性神经元行归零的两次配对审计来解决这个问题。我们首先在语言建模级别审核选择器:在识别五个 LLM 中的可有可无的行方面,归因方法大大优于基于激活和基于幅度的基线。然后,我们通过对比有害与良性信号来驱动行为测试,从而将相同的干预措施应用于行为测试中。归因的行足以对仇恨和犯罪进行拒绝,同时保持良性的过度拒绝较低并保持语言模型的流畅性,并且具体而言,相同深度的层匹配随机控制会失败。排名高度稳定的选择器可能是因果有效性最差的选择器之一。此外,拒绝存在于冗余子空间中,其中不同的归因方法通过很大程度上不相交的行集来安装它,因此恢复的编辑是充分集的一种实现,而不是一种独特的机制。总之,这些发现表明排名稳定性代理忽略了直接因果审计可能出现的选择器故障类型。%