论文

续写与拒绝之争:LLM续写触发式越狱的机制分析

The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs

模型评测模型行为与机制分析

摘要

随着大语言模型(LLM)的快速发展,LLM 的安全性已成为一个关键问题。尽管在安全调整方面做出了巨大努力,当前的大语言模型仍然容易受到越狱攻击。然而,人们对此类漏洞的根本原因仍然知之甚少,因此需要对学术界和工业界的越狱机制进行严格调查。在这项工作中,我们关注连续触发的越狱现象,简单地重新定位连续触发的指令后缀就可以大大提高越狱的成功率。为了揭示这种现象的内在机制,我们在注意力头层面进行了全面的机械可解释性分析。通过因果干预和激活缩放,我们表明这种越狱行为主要源于模型的内在持续驱动力和通过对齐训练获得的安全防御之间的固有竞争。此外,我们对已识别的安全关键注意头进行了详细的行为分析,揭示了不同模型架构中安全头的功能和行为的显着差异。这些发现为理解和解释大语言模型的越狱行为提供了一种新颖的机制视角,为提高模型安全性提供了理论见解和实际意义。

续写与拒绝之争:LLM续写触发式越狱的机制分析:论文配图
图1:连续触发越狱的流程。我们观察到,将继续触发的指令后缀放置在提示边界之外可能会触发越狱行为,从而导致有害内容的生成。