论文
大语言模型越狱成功的最小化局部因果解释
Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models
摘要
经过安全训练的大语言模型 (LLM) 通常可以通过越狱提示来回答有害请求。由于我们对大语言模型为何容易越狱缺乏深入的了解,未来在高风险环境中更自主运行的前沿模型可能同样容易受到此类攻击。之前的工作通过检查模型的中间表示来研究越狱成功,确定该空间中因果编码有害和拒绝等概念的方向。然后,他们将所有越狱攻击全局解释为试图减少或加强这些概念(例如,减少危害性)。然而,不同的越狱策略可能通过加强或抑制不同的中间概念而取得成功,并且相同的越狱策略可能不适用于不同的有害请求类别(例如,暴力与网络攻击);因此,我们试图给出一个本地解释——即为什么这次特定的越狱会成功?为了解决这一差距,我们引入了 LOCA,这是一种方法,通过识别一组最小的可解释的中间表示变化来给出越狱成功的本地因果解释,这些变化会因果地导致模型拒绝其他成功的越狱请求。我们通过 Gemma 和 Llama 聊天模型的大型越狱基准来评估有害的原始越狱对的 LOCA,并与适应此设置的先前方法进行比较。 LOCA 可以通过平均做出六种可解释的改变来成功诱导拒绝;之前的工作即使经过 20 次更改,通常也无法拒绝。 LOCA 是向大语言模型越狱成功的机械、本地解释迈出的一步。待发布代码。
