论文
最大限度地减少激活转向的附带损害
Minimizing Collateral Damage in Activation Steering
摘要
激活转向是一种通过干预其内部表示来控制 大语言模型 (LLM) 行为的方法,以增加与特定目标特征方向的对齐。然而,矢量相加等标准干预措施通常会导致“附带损害”,其定义为沿其他非目标特征方向的激活对齐的意外变化。发生这种损害是因为标准方法隐式假设非目标特征的各向同性。在这项工作中,我们提供了附带损害的数学形式化,并引入了一个原理框架,将转向建模为约束优化问题。我们的方法找到了一种新的激活,可以最小化由经验二阶矩加权的预期平方附带变化与在所有特征方向上均匀地惩罚变化的各向同性方法相比,这种加权对不同特征方向上的扰动的非均匀成本进行编码,通过考虑激活的经验二阶矩,我们的方法实现了更精确的控制,同时减少了模型在不相关任务上的性能下降。