论文

通过影响进行转向:用于激活转向的曲率感知数据加权

Steering by Influence: Curvature Aware Data Weighting for Activation Steering

模型推理推理验证与自校正

摘要

推理时控制通过估计激活空间中概念的表示并将激活转移到它,从而对语言模型的输出提供廉价、细粒度的控制。现有方法根据对比数据集的激活平均值构建这些表示。这些平均值包含不相关的概念和噪声,并且以一些token为主,这意味着激活传输编码token级别而不是主题概念。在这项工作中,我们倾向于最能表达主题概念的示例,而不是总体期望。我们使用影响函数来识别这些示例,该函数估计每个数据点对模型表示概念的贡献程度。与简单的模型激活相似性不同,它们结合了模型损失景观的曲率,使它们能够捕获超越表面token级别相似性的概念相关关系。然后,我们提出影响加权激活传输,它使用最佳传输将非概念文本的激活引导到概念文本的激活,通过影响分数对概念示例进行加权。我们对毒性抑制(Jigsaw)、基于对象的概念归纳(OneSec)和真实性归纳(TruthfulQA)进行评估,优于现有的激活传输基线。我们使用困惑度和 MMLU 精度跟踪转向后的能力,发现我们的方法改进了转向,同时在很大程度上保持了模型质量。我们进一步表明,影响函数捕获了基于激活的方法所遗漏的概念相关信息,这两种方法对数据点的排名显着不同。总之,这些结果证明了曲率感知影响信息对于激活转向的价值。

通过影响进行转向:用于激活转向的曲率感知数据加权的原论文方法或结果图
图 6:IF 加权传输矩阵 $\Gamma$ 概述。具有较大影响力分数的数据点将在 CDF 函数中具有较大的步长,因此分位数函数中的分位数较大,从而导致在 $\Gamma$ 中向其传输更多的质量。