论文

通过对比对搜索进行靶向神经元调节

Targeted Neuron Modulation via Contrastive Pair Search

模型评测模型行为与机制分析

摘要

语言模型经过指令调整以拒绝有害请求,但这种行为背后的机制仍然知之甚少。流行的转向方法对残余流进行操作,并在高干预强度下降低输出一致性,限制了它们的实际使用。我们引入了对比神经元归因 (CNA),它可以识别 0.1% 的 MLP 神经元,其激活最能区分有害提示和良性提示,只需要前向传递,无需梯度或辅助训练。在指导模型中,在标准越狱基准上,消除已发现的电路可将拒绝率降低 50% 以上,同时保持所有转向强度的流畅性和非退化性。将 CNA 应用于 Llama 和 Qwen 架构(从 1B 到 72B 参数)的匹配基础模型和指令模型,我们发现基础模型包含类似的后期辨别结构,但控制这些神经元仅产生内容转变,而不产生行为变化。这些结果表明,神经元级干预可以实现可靠的行为引导,而无需残差流方法的质量权衡。更广泛地说,我们的研究结果表明,对齐 微调 将预先存在的歧视结构转变为稀疏的、可定位的拒绝门。