论文

经精炼的安全目标嵌入利用

Safety Targeted Embedding Exploit via Refinement

模型评测安全与风险评测

摘要

大语言模型(LLM)的安全训练主要以英语进行——使安全机制对低资源语言与混合语言语码转换的泛化程度存疑。我们表明这造成一个认知缺口:模型对落在其安全训练分布之外的输入自信地生成有害响应。为研究该现象——我们介绍STEER(经精化的安全定向嵌入利用)——梯度引导攻击:识别对模型拒答行为贡献最强的词——并将其迭代翻译为低资源语言以抑制拒答——同时保持有害意图。跨六个开源8B参数模型——STEER在JailbreakBench上达至多93.0%、在AdvBench上达96.7%的攻击成功率——超越随机语码转换与贪婪坐标梯度(GCG)。所得提示还迁移到GPT-4o-mini——在无需访问目标模型的情况下取得35.5%攻击成功率——表明底层弱点并非特定于单一架构。这些发现表明主要以英语对齐的安全机制不能被假定泛化到多语言输入。我们主张改进多语言安全需要在对齐期间更广的覆盖——以及显式检测分布外输入并弃权的机制。

经精炼的安全目标嵌入利用:论文配图
图 1:STEER 管道。释义提示根据机械解释识别的拒绝方向提供基于梯度的单词归因,从而推动 11 种语言之间的迭代代码转换。每个候选者通过其在拒绝方向上的投影来评分;保留得分最高的翻译。循环重复T=8T=8次,直到法官确认越狱成功。