论文
GUISE与AXIS:跨语言叙事包装越狱评测及防御
How Narrative Wrapping Affects LLM Refusal: A Cross-Language Benchmark and Defense
摘要
安全一致的语言模型通常会拒绝直接提出的有害请求,但会在角色扮演或叙事包装中回答相同的请求。我们跨语言和跨寄存器测量该漏洞:Qwen3-1.7B 的攻击成功率在英语中已经达到 89.4%,在现代汉语中达到 93.0%,在文言文中达到 95.7%。我们构建了 GUISE,这是系统研究此漏洞的基准。它包括英语、现代汉语和古典汉语的并行请求、匹配的有害和良性对、用于评估的包装类型,以及将先警告后回答响应视为攻击成功的更严格标准。表征分析表明,语言和语域仅使有害请求表征稍微远离模型的拒绝方向,而叙事包装则使它们远离模型的拒绝方向。我们提出了 AXIS,它将偏好优化与轮换目标相结合,该轮换目标将有害请求表示与拒绝方向对齐,以及训练模型完全拒绝而不是产生一个承诺目标。 先警告后回答的响应。在 Qwen3-1.7B、Qwen3-4B 和 GLM-4-9B 中,AXIS 在比较方法中获得了最高的综合安全性和可用性得分。