论文
安全悖论:增强的安全感知如何使LLM易受后验攻击
Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack
摘要
大型语言模型(LLM)经过严格调整,拒绝有害请求,这一过程本质上培养了评估和识别不安全内容的潜在能力。在这项工作中,我们揭示了这种先进的安全意识无意中引入了致命的漏洞。我们引入了后攻击,这是一种单查询越狱,通过提示模型生成其内部分类器通常会标记为不安全的确切有害响应来绕过护栏。通过对 30 个开源 LLM(大小高达 35B 参数)和前沿模型(例如 GPT-5、Claude 4.6)进行广泛的实证评估,我们观察到一个惊人的现象:具有卓越安全判断能力的模型更容易受到这种利用。为了解释这一点,我们将安全悖论形式化,分析表明安全对齐的单调改进自然会放大后验脆弱性。最后,我们通过强化学习干预建立因果关系,举例说明人为降低模型的安全判断可以使其免受攻击,而增强判断会加剧脆弱性。我们的研究结果强调了当前对齐范式的潜在缺陷,表明防御机制可能需要进一步的结构完善。
