论文

打破刹车,而不是车轮:通过熵最大化实现无目标越狱

Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization

模型评测安全与风险评测

摘要

最近的研究表明,视觉语言模型(VLM)上基于梯度的通用图像越狱几乎没有或根本没有跨模型可转移性,这使人们对可转移的多模式越狱的可行性产生了怀疑。我们在严格无针对性的威胁模型下重新审视这个结论,而不强制执行固定的前缀或响应模式。我们的初步实验表明,在自回归解码过程中,拒绝行为集中在高熵词元上,并且在攻击之前,非拒绝词元在排名靠前的候选者中已经具有相当大的概率质量。受这一发现的启发,我们提出了通过熵最大化(UJEM)-KL 的无目标越狱,这是一种轻量级攻击,可以最大化这些决策词元的熵以翻转拒绝结果,同时稳定剩余的低熵位置以保持输出质量。在三个 VLM 和两个安全基准中,UJEM-KL 实现了具有竞争力的白盒攻击成功率,并持续提高可转移性,同时在代表性防御下保持有效。我们的实验结果表明,有限的可转移性主要源于过度约束的优化目标。