扰动探测:对齐 LLM 中 FFN 行为电路的两次通过每次提示诊断
Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs
摘要
扰动探测为 大语言模型 中的 FFN 神经元生成任务特定的因果假设,每个提示使用两次前向传播且不进行反向传播,然后进行约 150 次传递的一次性干预扫描,摊销到所有已识别的神经元上。在 8 个行为电路、13 个模型和 4 个架构系列中,我们确定了两种组织 LLM 行为的电路结构。当 RLHF 抑制 预训练 趋势时,就会出现对立电路。在安全拒绝中,大约有 50 个神经元,即所有神经元的 0.014%,控制着拒绝模板;消除它们会改变 520 个 AdvBench 提示中 80% 的响应格式,同时产生接近于零的有害合规性(520 个案例中的 3 个案例),所有案例均带有免责声明。通过注意力分布的 预训练 行为出现路由电路。对于语言选择,在 19 个测试模型中的 3 个中,残差流方向注入将 580 个基准提示中 99.1% 的英语输出切换为中文输出,满足三个观察条件:双语训练、0.3 和 1.1 之间的 FFN-to-skip 信号比以及线性可表示性。同样的干预在其他 16 个模型以及数学、代码和事实电路上都失败了,从而定义了方向转向的局限性。根据相同的两次前向传递计算出的 FFN 与跳跃信号比可以区分这两种结构并预测适当的干预。电路拓扑因架构而异,从 Qwen 的集中 FFN 瓶颈到 Gemma 的归一化屏蔽电路。在 Qwen3.5-2B 中,消融 20 个神经元消除了多轮阿谀投降,而放大 10 个相关神经元则将 200 个 TruthfulQA 提示的事实纠正率从 52% 提高到 88%。这些结果表明,扰动探测提供了对 RLHF 组织行为的机械洞察,以及用于精确模板层编辑的实用工具包。