论文

一次一个字:增量完成分解破坏LLM安全

One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety

模型评测安全与风险评测

摘要

大语言模型 (LLM) 经过训练可以拒绝有害请求,但它们仍然容易受到利用会话安全机制弱点的越狱攻击。我们引入了增量完成分解 ICD,这是一种基于轨迹的越狱策略,可在引发完整响应之前引发与恶意请求相关的一系列单字延续。此外,我们提出了使用模型生成或攻击者注入的中间延续以及最终响应预填充的 ICD 变体。我们在一系列广泛的开放权重模型系列中评估了这些变体,与现有方法相比,在 AdvBench、JailbreakBench 和 StrongREJECT 上展示了卓越的攻击成功率 (ASR)。此外,我们还提供了 ICD 为何有效的理论解释,并提供了机制证据,表明成功的攻击轨迹会抑制与拒绝相关的表征,并将激活从安全一致的状态转移开。