论文
SteerScope:LLM 干预方法的多维副作用评测
Does Steering Break Your Model? A Multi-Dimensional Evaluation Suite for LLM Steering Methods
摘要
激活转向提供了一种轻量且灵活的方式来控制大语言模型 (LLM) 行为。然而,有效的引导需要的不仅仅是诱导预期的行为:它还应该限制意外的变化,并在输入和训练数据之间保持稳健。现有的评估仅零散地涵盖了这些维度。因此,功效和副作用之间的权衡尚未得到系统的表征。我们推出 SteerScope,这是一个两轴、多维评估套件,通过 15 个指标共同表征转向结果和方法属性。我们对语言质量、任务能力以及安全性和可靠性的目标功效和副作用进行评分,并通过针对样本效率和样本敏感性的特定指标来进一步评估泛化性和数据依赖性。我们不是在单个操作点比较方法,而是描述功效和副作用之间的权衡。在匹配的模型、任务和评估协议下,我们对跨越 4 个系列的 23 种方法进行了基准测试,包括提示、LoRA 和 SFT 作为基线方法,并将该套件作为可扩展的代码库发布。我们发现,当前的激活转向方法在转向功效和副作用之间的总体平衡方面尚未超过提示转向基线:在两个模型尺度上,没有经过评估的激活转向方法能够在不产生更大的复合副作用的情况下实现更高的功效。我们进一步揭示了转向功效和副作用之间的一致耦合。在 OOD 提示下,目标功效通常得以保留,而副作用往往变得更加明显,特别是通过教学相关性和流畅性的下降。方法还表现出截然不同的样品效率曲线。
