论文

语言切换触发器通过语言模型进行潜在的绕行

Language-Switching Triggers Take a Latent Detour Through Language Models

模型评测模型行为与机制分析

摘要

对语言模型的后门攻击引起了越来越多的安全问题,但触发序列劫持模型计算的内部机制仍然知之甚少。我们在 8B 参数自回归语言模型中识别出语言切换后门的底层电路,其中三个单词的拉丁语触发器(九个标记)将英语输出重定向为法语。我们将电路分解为三个阶段:(1)早期层的分布式注意力头将触发词元组成到最后一个序列位置; (2) 产生的信号通过与模型的自然语言身份方向正交的子空间中的中间层传播; (3) 最后一层的 MLP 将这个潜在信号转换为法语 logits。整个电路流经单个位置的串行瓶颈:在任何层破坏该位置都会完全减轻触发,但也会阻碍模型的功能。正交潜在编码表明,在中间表示中搜索类似语言信号的防御措施将完全错过这个触发因素。