论文
实现不牺牲的转向:对转向向量进行有原则的训练,以进行即时干预
Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions
摘要
最近,转向向量(SV)已成为一种有效且轻量级的方法来控制 大语言模型(LLM)的行为,其中微调的 SV 比无优化的 SV 更有效。然而,当前微调 SV 的方法存在两个局限性。首先,它们需要在每个 SV 的基础上仔细选择引导因子,以平衡推理时的引导有效性和生成质量。其次,它们作为全序列SV(FSSV)运行,由于对模型生成过程的过度干预,无论因素选择如何,都会牺牲生成质量。为了解决第一个限制,我们建议联合训练引导因素和方向,这样就不再需要事后因素选择。使用神经网络缩放理论,我们发现适度大的初始化大小和转向因子的学习率对于联合训练的稳定性和效率至关重要。为了解决第二个限制,我们从表示 微调 中汲取灵感,并引入仅提示 SV (PrOSV),这是一种仅干预少数提示标记的 SV。我们的实证结果表明,使用我们的联合训练方案时,PrOSV 在 AxBench 上的表现优于传统 FSSV。我们还发现,与 FSSV 相比,PrOSV 在通用模型效用和对抗鲁棒性之间实现了更好的权衡。