论文

一阶转向:将重量适应转化为激活转向

First-Order Steering: Translating Weight Adaptation into Activation Steering

模型推理解码与生成控制

摘要

激活控制利用残余流中的可解释方向来实现对模型行为的推理时操作。组合转向向量以同时应用多个目标行为在包括人工智能对齐和安全在内的各个领域都很重要,但对于现有的激活转向方法来说仍然是一个挑战。相比之下,模型合并方面的先前工作表明,由学习到的权重适应所代表的目标行为可以以高精度进行组合。因此,将权重适应转化为激活引导向量的方法可以扩展模型合并中的先前工作,以生成可组合的引导向量,从而更好地实现同时推理时行为控制。为此,我们引入一阶转向,这是一种激活转向的公式,作为由转向强度向量参数化的权重更新矩阵的一阶近似,并建立一阶转向的近似误差的理论界限。然后,我们开发了一种新颖的模型合并程序 HeRD-Merging,它可以最小化一阶近似误差项,以实现更高的一阶转向精度。总之,我们的方法产生的引导向量比现有的激活引导方法更准确地控制个体和组合行为。此外,HeRD-Merging 与传统模型合并基线的性能相匹配,同时产生允许更准确的一阶转向向量的权重调整。

一阶转向:将重量适应转化为激活转向的原论文方法或结果图
图 1:每层引导矩阵的 Frobenius 范数。