论文
LASH:用于 大语言模型 黑盒越狱的自适应语义混合
LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
摘要
越狱攻击暴露了对齐的 大语言模型 的预期安全行为与其在对抗性提示下的行为之间持续存在的差距。现有的自动化方法越来越有效,但每种方法都致力于单一的攻击系列(例如,一种细化循环、一种树搜索、一种突变空间或一种策略库),并且没有单一的系列占主导地位:性能最佳的方法在目标模型和危害类别之间变化,这表明每个提示组合可以利用互补的优势。我们引入了 LASH(LLM 自适应语义混合),这是一个黑盒框架,它将多个基本攻击的输出视为可重用的种子提示,并针对每个目标请求自适应地组合它们。给定种子池,LASH 搜索种子子集和 softmax 归一化混合权重;合成模块合成单个候选提示,无导数遗传优化器使用黑盒目标反馈和结合基于关键字的拒绝检测与 LLM 判断评分的两阶段适应度函数来更新权重。 JailbreakBench 包含 10 个类别的 100 个有害提示,我们在 6 个常见目标模型上评估了 LASH。 LASH 在基于关键字的评估下的平均攻击成功率为 84.5%,在两阶段评估下的平均攻击成功率为 74.5%,其中响应首先过滤拒绝,然后由 LLM 法官评分,以确定它们是否实质上满足了原始有害请求。 LASH 在两个指标上均优于 5 个最先进的基线,平均目标查询数仅为 30 个。 LASH 还在三种防御机制下保持竞争力,并引发更多类似成功的内部表征。这些结果表明,跨异构越狱策略的自适应组合是黑盒红队的一个有前途的方向。