论文
LLM 除了文本之外是否安全:表情符号是否会暴露安全评估中的差距
Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation
摘要
大语言模型 (LLM) 的安全评估主要依赖于基于文本的对抗性提示,可能会忽略替代输入表示形式产生的漏洞。这项工作将表情符号增强提示作为这一差距的测试用例,评估了四个开源 LLM(Mistral 7B、Qwen 2 7B、Gemma 2 9B、Llama 3 8B)中的 50 个提示。结果显示稳健性存在显着差异:Gemma 2 9B 和 Mistral 7B 表现出非零成功率 (10%),Llama 3 8B 6%,而 Qwen 2 7B 显示完全耐药性(0% 成功率)。卡方检验 ($χ^2 = 32.94, p < 0.001$) 证实结果分布存在显着差异。这些发现表明,鲁棒性对输入表示很敏感,并且仅限于标准文本提示的评估可能会低估模型的漏洞。