论文
当行为安全评估失败时:代表性层面的视角
When Behavioral Safety Evaluation Fails: A Representation-Level Perspective
摘要
大语言模型 (LLM) 的安全评估主要是行为性的:当模型拒绝有害请求并回答良性请求时,该模型就被证明是安全的。但拒绝审计员碰巧尝试的提示并不表明该模型远离有害行为。行为测试观察输出;他们没有衡量对模型的干预将拒绝转变为服从的容易程度。我们将静态审计所证明的内容与干预措施可以达到的审计差距之间的差距称为审计差距,并且我们证明这是可以实现的:人们可以构建一个模型,该模型与每次静态审计的安全基础相匹配,但又允许其内部状态发生微小的、已知的扰动。我们从三个安全相关的基础(Gemma 2 2B、Llama 3.2 3B、Qwen 2.5 3B)构建了这样的分离模型,并在参数和潜在空间中使用相同的软干预来审核基础、分离和公开有害的模型;潜在攻击通过潜在漏洞评分 (LVS) 进行总结,即每单位有界潜在扰动产生的安全降级。我们运行的每次静态审计都会给分离模型与其基础相同的结论,因为它的拒绝与基础相匹配,越狱没有显示一致的签名,并且对干净激活的强大固定探针无法将其与基础区分开来。审计师采取同样的干预措施也可以推翻判决。在目标中间层,分离模型的 LVS 得分比其基础高 2.5 至 3.1 倍。有界潜在攻击会在 54% 到 86% 的提示上引发有害的依从性,而对于碱基则为 3% 到 48%,而匹配的随机扰动则保持在或低于 12%。有害的 微调 在 5 个梯度步骤内达到高合规性,其中碱基需要 10 到 25。行为测试,即使使用静态潜在探测,也无法证明表示级稳健性:安全审计必须对模型进行干预,而不仅仅是观察模型。