论文

转向后的LLM激活是非满射的

Steered LLM Activations are Non-Surjective

模型评测模型行为与机制分析

摘要

激活控制是一种流行的白盒控制技术,它修改模型激活以引发输出行为的抽象变化。它也成为可解释性的标准工具(例如,探测真实性,或将激活转化为人类可读的解释和安全研究(例如,研究越狱性)。然而,尚不清楚引导激活状态是否可以通过任何文本提示实现。在这项工作中,我们将这个问题视为一个满射问题:对于固定模型,每个引导激活是否在模型的自然前向传递下都承认原像?在实际假设下,我们证明激活几乎可以肯定的是,没有提示可以在三个广泛使用的 LLM 中重现这一发现,因此我们警告不要将激活转向的容易性和成功解释为基于提示的可解释性或脆弱性的证据,并主张明确分离白盒和黑盒干预的评估协议。

转向后的LLM激活是非满射的
图 1:大语言模型承认可数且实际上有限数量的提示 𝒱 ≤ K \mathcal{V}^{\leq K} 。此属性意味着在其真实激活空间 ℝ d \mathbb{R}^{d} 中存在空洞:不映射回任何提示的区域。我们表明,激活引导(一种流行的改变模型行为的白盒干预方法)几乎肯定会将激活引导到这样的漏洞中,从而导致几乎肯定的非主观性,即任何真实的提示都不会表现出引导的模型行为。详细信息参见第 4 节。