论文
转向何处:用于转向的输入相关层选择可改善 LLM 对齐
Where to Steer: Input-Dependent Layer Selection for Steering Improves LLM Alignment
摘要
引导向量已成为一种轻量级且有效的方法,用于在推理时对齐 大语言模型 (LLM),通过将 LLM 表示转向目标行为来实现对模型行为的调制。然而,现有方法通常在全局固定层应用引导向量,隐含地假设最佳干预层在输入之间不变。我们认为这种假设从根本上是有限的,因为与目标行为相关的表示可以根据输入在不同的层进行编码。从理论上讲,我们表明不同的输入可能需要在不同层进行控制,以实现与所需模型行为的一致性。我们还提供了经验证据,表明最佳引导层在实践中的输入之间存在很大差异。受这些观察的启发,我们引入了Where to Steer(W2S),这是一个框架,通过学习从输入嵌入到最佳转向层的映射,自适应地选择以输入为条件的干预层。在多个 LLM 和对齐行为中,W2S 始终优于固定层基线,并在分布内和分布外设置方面都有改进。我们的研究结果强调了 LLM 对齐中依赖于输入的控制的重要性,并证明自适应层选择是当前引导向量方法中缺少的关键设计维度。