论文
大语言模型 中激活转向的对抗鲁棒性
Adversarial Robustness of Activation Steering in Large Language Models
摘要
激活引导已成为一种流行的 无需训练 方法,通过在推理时将预先计算的方向向量注入模型的残差流来控制 LLM 行为。然而,其对实际输入变化的鲁棒性仍未得到研究。我们首次对输入的对抗性文本扰动下的激活控制鲁棒性进行系统评估,涵盖四种提取方法、三种攻击策略、来自人择模型编写评估数据集的六个角色以及从 1.5B 到 30B 参数的五个模型。攻击在所有设置中都取得了广泛成功:方向鲁棒性下降高达 64%,所有方法和模型的攻击后置信度都崩溃到接近或低于 0.25,并且几乎每个可操纵输入的操纵强度都会下降。层选择同样脆弱,通过自动方法在干净输入上识别的最佳层在扰动下移动了多达 17 个位置,这种失败加剧了向量级故障。从受到对抗扰动的输入中提取向量可以部分恢复中大型模型上 PCA 和 MD 的可操纵性,但它们始终无法找到改进的最佳层,从而限制了这种缓解措施的实际效益。总之,这些发现表明,激活控制的脆弱性是结构性的,而不是特定于方法的,并且当前的层选择策略对于现实世界的部署来说不够稳健。