论文

当情感成为触发点:情感式动态后门攻击寄生 大语言模型

When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models

模型评测安全与风险评测

摘要

数据中毒后门对大语言模型(LLM)的微调构成实际威胁。大多数现有攻击将攻击者选择的行为绑定到固定的标记、短语、场景或句法结构。这些离散触发器为基于本地词元异常、模式匹配或触发器恢复的防御提供了具体的处理方法。我们发现,\emph{在保留语义的重写下,情感风格的输入形成与其中性对应部分不同的表示簇}。与此同时,去情绪化的控制又回到了中性分布。这一观察激发了我们的方法 \textbf{Paraesthesia},这是一种动态后门攻击,以情感风格对其触发条件进行编码。感觉异常将目标情绪映射到价态——唤醒空间,重写一小部分干净样本,并保留 微调 语义上忠实的重写。在四个主要 LLM 上评估的指令跟踪和分类任务中,感觉异常实现了 98.25% 以上的攻击成功率 (ASR),同时在绝大多数模型任务设置中仅引入了可以忽略不计的清洁效用降级。表面特征控制和配对去情绪化实验表明,没有经过检查的 词元级 线索可以完全解释触发的行为。在字级过滤、样本聚类和后续的清理更新程序之后,ASR 仍然很高,而可以访问任务对齐的清理引用的白盒解码防御提供了独特的缓解路径。这些发现将情感风格确定为超越固定词汇和句法模式的具体后门触发面。\par\smallskip \noindent \textcolor{red}{\textbf{警告:}\textnormal{本文包含与风险相关的文本内容。}}