论文

解开转向向量

Disentangling Steering Vectors

模型推理解码与生成控制

摘要

激活引导已成为一种轻量级的推理时间方法,用于控制 大语言模型 (LLM) 的行为。然而,用于干预 LLM 激活的传统引导向量(例如源自均值差异方法的引导向量)往往会将多个语义和文体概念纠缠成单个复合方向,从而导致不可预测的引导效果。我们的核心目标是将这个复合方向分解为其组成概念。为此,我们提出了转向向量剖析(Steering Vector Dissection),这是一个框架,可以将单个且语义一致的特征与这些复合方向明确隔离。具体来说,我们将正激活和负激活配对,并利用它们的差异来生成一组实例级引导向量,并直接在它们上训练专用的稀疏自动编码器(SAE)。跨两个数据集、两个模型和两个干预深度的定量评估表明,我们的方法产生了一组语义一致的基本向量,其引导效果是相互可区分的。此外,我们表明这种解开可以精确控制模型行为。