论文

Curveball Steering:正确的转向方向并不总是线性的

Curveball Steering: The Right Direction To Steer Isn't Always Linear

模型推理解码与生成控制

摘要

激活引导(activation steering)是一种通过干预内部表示来控制大语言模型(LLM)行为的广泛使用的方法。现有方法在很大程度上依赖线性表示假设(Linear Representation Hypothesis),假定行为属性可以通过全局线性方向加以操纵。然而在实践中,这类线性干预常常表现不一致。我们通过分析LLM激活空间的内在几何来质疑这一假设。通过测地线距离与欧氏距离之比来度量几何畸变,我们观察到显著且依赖概念的畸变,表明激活空间并不能被全局线性几何很好地近似。受此启发,我们提出“Curveball steering”,一种基于多项式核PCA的非线性引导方法,在特征空间中执行干预,从而更好地遵循习得的激活几何。Curveball steering持续优于基于线性PCA的引导,尤其在呈现强几何畸变的情形中,这表明几何感知的非线性引导为全局线性干预提供了一种有原则的替代方案。

Curveball Steering:正确的转向方向并不总是线性的:论文配图
图 1:曲线球转向概述和实证结果。 A 通过非线性映射 phi\phi,核空间中 A 类和 B 类之间的线性路径对应于原始激活空间中的非线性轨迹。这就是我们的曲线球转向方法。对两个模型(Llama-3.2-1B-It 和 Phi-3.5-mini-It)对安全相关行为和语言特征指导任务的实证评估。 B 评估表明,曲线球转向在多个行为属性上始终优于线性转向(右上)。性能的提高对应于数据集激活流形中始终较高的曲率。 C 对于跨不同情感特征的开放式一代转向(以 Δ\Deltajudge 分数衡量),曲线球转向显示出许多功能的显着改进(右下)。示例演示了一个二元选择问题,其中转向影响模型选择权力寻求响应的概率,以及带有中立和热情响应的一般问题的提示。