论文

LLM知道自己的脆弱场景吗?

Do LLMs Know Their Vulnerable Scenarios?

模型评测模型行为与机制分析

摘要

安全对齐的大语言模型被训练来拒绝有害请求,但把同样的请求嵌入特定场景可以绕过其安全防线。现有红队方法通过观察攻击结果从经验上识别有效场景,但为什么特定场景会削弱拒绝机制在机理上仍不清楚。与此同时,机理可解释性研究已刻画了拒绝方向与越狱相关特征,却没有解释这两种表示之间的关系。在本工作中,我们证明场景包装的提示会激活内部场景方向,其因果引导会持续降低拒绝分数。基于这一发现,我们提出Concept2Scenario,一个用于脆弱场景发现的基于概念的归因框架。它用稀疏自编码器实例化一个宽泛的概念空间,将拒绝抑制归因到单个概念,把识别出的概念翻译为可解释的自然语言场景,并通过交互归因识别具有协同效应的场景组合。在三个开源模型、两个安全基准与六种黑盒越狱方法上,所发现的场景作为可复用先验,使平均攻击成功率最多提升18.2个百分点。它们还能迁移到GPT-5、Claude-Haiku-4.5与Gemini-3-Flash,表明某些场景层面的拒绝漏洞在不同模型家族之间是共享的。此外,识别出的组合优于其各自的单独成分,并使迭代攻击能以更少轮次成功。

LLM知道自己的脆弱场景吗?:论文配图
图 1. 越狱的机制视图。 LaTeX 越狱场景中包含的有害请求可以抑制模型的拒绝方向。直接控制 LaTeX 场景方向会产生类似的抑制效果。我们使用 Llama-3.1-8B-Instruct 并分别在第 27 层和第 31 层提取场景和拒绝方向。三个面板比较直接有害请求、包装在 LaTeX 场景中的相同请求以及使用 LaTeX 场景方向的直接转向。相对于直接请求,包装请求和引导干预都降低了模型的拒绝分数。