论文
杠杆作用未达到:语言模型中单神经元控制的控制窗口定律
Leverage Is Not Reach: A Control-Window Law for Single-Neuron Steering in Language Models
摘要
对齐的语言模型通过稀疏的前馈神经元来控制拒绝和语言路由等行为,但没有理论预测单个神经元干预何时连贯地控制行为而不是破坏输出。我们开发了用于单神经元控制的预算归一化控制窗口框架。沿着一个写入方向的剂量减少到一个控制坐标:残余流和写入之间的对准,沿着通用饱和曲线驱动,以由残余范数除以写入范数设置的相干预算为单位。当行为触发因素低于崩溃上限时,就会存在连贯控制。相同的坐标控制良性模式切换和拒绝;上限来自权重和一个通用的前向传递,而触发器是在采样时测量的。在 15 个保留的神经元上,预测上限的平均绝对误差为 0.14,在批量层中约为 0.07,并且相对于 15 个多数基线中的 10 个,所提交的开放或封闭判决保持在 11 个上。封闭的案例暴露了三种失败模式而不是违规:触发前崩溃、传播深度太少,或者限制一个神经元可以推动的距离的标准化。该定律解释了为什么局部梯度归因反预测控制:真正的控制器注销读出轴并携带接近零的一阶梯度。窗口精确的前向对比屏幕可恢复归因错过的控制器。在拒绝时,最困难的情况,干预成功是类型化的,而不是标量的:连贯的旁路和严格的可操作的到达是分开的,因此神经元可以在没有可操作内容的任务文本上流畅地翻转拒绝,并且真正的可操作的到达仅出现在六个经过审计的 Llama 枢轴中的三个,并且仅在以后的采样轨迹范围内出现。因此,单神经元控制是对可控性的预算、类型化审计,而不是固定剂量的轶事。