论文

针对安全表示进行优化:激活引导的对抗性后缀和拒绝的几何结构

Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal

模型评测安全与风险评测

摘要

大语言模型 中的行为对齐通常掩盖了脆弱的内部安全表示。最近的研究表明,拒绝行为是由激活空间中的低维方向介导的。这就提出了如何通过优化来构建、本地化和访问此类表示的问题。我们研究对抗性后缀攻击作为表征对齐的探针。我们引入了激活引导 GCG,它用直接针对模型内部拒绝方向的损失取代了基于输出的目标。在几个目标变体中,我们发现在所有层和位置上全局抑制拒绝比针对单个层位置对更有效。这表明安全表示分布在前向传播中,而不是因果地局限于单个站点。我们进一步介绍 Soft-GCG,一种使用 Gumbel-Softmax 的离散后缀优化的连续松弛。 Soft-GCG 比标准 GCG 实现了 33 $\times$ 的加速,同时提高了攻击成功率。通过跨模型规模进行评估,我们发现较小的模型仍然容易受到攻击,而较大的模型在计算受限的设置下可以抵抗基于激活和后缀的攻击,这与更大、更好的安全训练模型更难越狱是一致的。总之,我们的结果阐明了安全机制是如何在当代模型中编码和破解的。这些见解为设计更强大和具有代表性的对齐策略提供了具体指导。