论文
面向LLM越狱的自适应提示嵌入优化
Adaptive Prompt Embedding Optimization for LLM Jailbreaking
摘要
现有针对对齐LLM的白盒越狱攻击通常在用户提示末尾附加离散的对抗性后缀,这会明显改变提示本身,且在组合式的词元空间中操作。以往工作避免直接优化原始提示词元的嵌入,原因大概是扰动它们会破坏提示的语义内容。我们提出提示嵌入优化(Prompt Embedding Optimization, PEO),一种多轮白盒越狱方法,直接优化原始提示词元的嵌入而不附加任何对抗性词元,并证明这一担忧并无根据:优化后的嵌入与其原始值足够接近,经最近词元投影后可见的提示字符串得以精确保留,且定量分析表明模型的回答在绝大多数提示上仍切题。PEO将连续嵌入空间优化与结构化续写目标以及聚焦失败的自适应调度相结合。与直觉相反,PEO的后期轮次可以受益于那些并非自然独立模板的启发式复合回答脚手架,而ASR-Judge表明由此获得的收益并非只是空洞的格式或仅有脚手架的输出。在两个标准有害行为基准以及涵盖离散后缀搜索、附加对抗嵌入与基于搜索的对抗生成等竞争性白盒攻击上,PEO在我们的实验中优于所有这些方法。