论文
逃脱对齐:Best-of-N越狱的物理陷阱模型
Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking
摘要
Best-of-$N$ 越狱 (BoN) 通过绘制不安全提示的 $N$ 独立增强并对每个 $M$ 完成进行采样,绕过了对齐模型的保护措施。之前的研究表明,攻击成功率(ASR)似乎遵循 $N$ 的幂律,我们对此提出质疑。指数随 $N$ 漂移,具有指数交叉,这是对抗数据集的有限大小的工件。探索整个双预算($N,M$)攻击面及其对生成温度 $T$ 的依赖性的工作还很少。我们引入了一个简单的屏障模型,其中每个提示都有一个基线安全级别,每个增强都有一个随机热激活屏障。然后四个数字,每个数字都由可解释的安全机制支持,确定整个($N,M$)攻击面。他们将预测从 $N \leq 100$ 推断到 $N = 10^4$,在同一缩放函数上折叠五个不同的模型,并预测与它们拟合的温度不同的 ASR。