论文

超越线性激活转向:用于控制 LLM 行为的可逆潜在变换

Beyond Linear Activation Steering: Invertible Latent Transformations for Controlling LLM Behavior

模型推理解码与生成控制

摘要

激活引导提供了一种轻量级推理时间机制,用于通过将内部激活向量修改为所需的行为来控制 大语言模型 (LLM)。大多数现有方法通常使用均值差、线性探针或任意可分离性标准从成对的对比示例中计算原始激活空间中的固定转向方向。虽然在一定程度上有效,但这些方法将行为控制视为全局、线性、加性偏移:跨输入应用相同的方向,并且行为是线性可分离的。当行为特征在激活空间中非线性变化或位于弯曲和各向异性流形上时,这可能会受到限制,其中最佳干预可能取决于输入。为了解决这个限制,我们提出了 INNSteer,一种基于可逆潜在变换的非线性激活控制框架。 INNSteer 不是在原始表示空间中寻找更好的转向向量,而是学习一个轻量级可逆神经网络 $φ$,它将 LLM 的激活映射到行为类别更适合线性控制的潜在空间。在推理时,激活通过 $φ$ 映射,在潜在空间中引导,并通过精确的逆变换 $φ^{-1}$ 映射回来。这使得简单的潜在空间转换成为原始激活空间中的非线性、依赖于输入的干预。在多个 LLM 系列、规模、行为特征和安全基准的实验设置中,INNSteer 不断改进对线性、基于传输和非线性转向基线的模型控制,同时在很大程度上保持生成流畅性。