论文

转向信号从何而来:激活转向中的激活源选择

Where Steering Signals Come From: Activation Source Selection in Activation Steering

模型评测模型行为与机制分析

摘要

激活引导通过在推理时向隐藏状态添加向量或特征来控制语言模型,但这些引导信号的上游源通常被视为次要细节。我们将这种源选择研究为激活源选择:源上下文和激活读出策略的组合,用于收集构建转向信号的隐藏状态。保持下游干预固定,我们在三个指令调整模型和四个转向任务系列中展示,仅改变源激活就可以显着改变转向成功。我们进一步发现,有效的引导并不能简单地通过期望的行为是否出现在源文本中来解释。相反,强信号来自执行边界状态,其中模型即将产生或继续目标行为。这种实现前/实现后的区别解释了为什么基于答案的源有时会起作用:它们的有用组件与执行边界方向一致,而不仅仅是目标外观。基于这个观点,我们引入了尾部减法,它从边界状态中删除了共享的提示和延续语义,并产生更清晰、更稳定的转向信号。总的来说,我们的结果表明,转向取决于模型将要做什么的表示,而不仅仅是已经出现的事情。