论文

转向干扰反映了模型的默认值,而不是行为方向

Steering Interference Reflects the Model's Defaults, Not the Behavior Directions

模型评测模型行为与机制分析

摘要

激活控制承诺对语言模型行为进行模块化控制:诸如礼貌之类的行为对应于模型激活中的方向,并且在生成时添加该方向应该会打开该行为并保留其他所有内容。事实并非如此。我们询问是什么决定了哪些其他行为移动以及移动了多少,然后发现是模型而不是被引导的行为。引导者将模型放宽到它已经喜欢的一小部分行为,主要是拒绝、阿谀奉承和诗意,而无论被引导什么,这组行为都大致相同。 24 种行为和 10 个指令调整模型的三个结果支持了这一点,每个效果都是由语言模型判断而不是探针读取生成的文本。读数很重要:所有 24 种行为都是线性可解码的,但只有 20 种行为会改变模型写入的内容。首先,不携带任何行为内容的方向,仅在其添加的矢量大小上与真实的转向相匹配,以与真实的转向相同的顺序移动相同的行为,同时不产生任何需要特定方向的行为。其次,大多数干扰都是单向的,因此它不可能是两个方向之间的重叠:转向脏话会使模型有毒,而转向毒性则不会影响脏话。第三,在完全保留一种行为的情况下,在其他行为上测量的几何形状几乎无法解释它所参与的任何干扰。该帐户适用于所有十个模型,默认值的拉力低于 10B 参数最强,并且每个系列最大​​的参数都减弱。将转向视为一种扰动,其端点由模型固定,这意味着解开行为方向本身无法使转向模块化。