论文
经精炼的安全目标嵌入利用
Safety Targeted Embedding Exploit via Refinement
摘要
大语言模型(LLM)的安全训练主要以英语进行——使安全机制对低资源语言与混合语言语码转换的泛化程度存疑。我们表明这造成一个认知缺口:模型对落在其安全训练分布之外的输入自信地生成有害响应。为研究该现象——我们介绍STEER(经精化的安全定向嵌入利用)——梯度引导攻击:识别对模型拒答行为贡献最强的词——并将其迭代翻译为低资源语言以抑制拒答——同时保持有害意图。跨六个开源8B参数模型——STEER在JailbreakBench上达至多93.0%、在AdvBench上达96.7%的攻击成功率——超越随机语码转换与贪婪坐标梯度(GCG)。所得提示还迁移到GPT-4o-mini——在无需访问目标模型的情况下取得35.5%攻击成功率——表明底层弱点并非特定于单一架构。这些发现表明主要以英语对齐的安全机制不能被假定泛化到多语言输入。我们主张改进多语言安全需要在对齐期间更广的覆盖——以及显式检测分布外输入并弃权的机制。
