论文
转向后的LLM激活是非满射的
Steered LLM Activations are Non-Surjective
摘要
激活控制是一种流行的白盒控制技术,它修改模型激活以引发输出行为的抽象变化。它也成为可解释性的标准工具(例如,探测真实性,或将激活转化为人类可读的解释和安全研究(例如,研究越狱性)。然而,尚不清楚引导激活状态是否可以通过任何文本提示实现。在这项工作中,我们将这个问题视为一个满射问题:对于固定模型,每个引导激活是否在模型的自然前向传递下都承认原像?在实际假设下,我们证明激活几乎可以肯定的是,没有提示可以在三个广泛使用的 LLM 中重现这一发现,因此我们警告不要将激活转向的容易性和成功解释为基于提示的可解释性或脆弱性的证据,并主张明确分离白盒和黑盒干预的评估协议。
