论文
Semantic Overlays:用超越token与转向向量的标注缓解提示注入
Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors
摘要
语言模型看到的一切都是token。服务栈知道每个片段是什么——用户输入、工具输出、指令——但模型必须自己跟踪这些信息,而且它可能丢失跟踪或被混淆:文本可以被写成读起来像任何东西。提示注入是这种现象的自然利用方式。通过打乱模型对片段身份的理解,攻击者可以诱发不需要的、潜在危险的行为。在模型输入中增加一条非文本通道——一种在文本之外传达片段身份的方式——可以缓解这类攻击。因此我们提出一种通用转向技术,称为Semantic Overlays(语义覆盖层):在冻结模型的残差流上、于选定的预填充位置应用的小型学习适配器。在片段上铺设覆盖层会创建一个token无法复制的带外标注通道。与转向向量不同,Semantic Overlays是经过训练的、可适应的、有选择地应用的。覆盖层可以编码复杂语义,重塑模型对被标记片段的感知:当要求模型复制一段代码片段,而覆盖层断言它是另一种编程语言时,模型会忠实地用所断言的语言重写该片段。覆盖层还可组合,允许透明读取底层内容,并可承载复杂载荷——包括模型会遵循的指令。将片段标记为“不可执行”的覆盖层可以防御在不可信上下文中添加指令这一大类提示注入。我们在提示注入基准上报告了强劲结果:SEP分离度从24.3%升至96.5%而效用不变(我们的评分规则;我们还修正了已发布评分器中的一个缺陷),TensorTrust攻击成功率从34.8%降至6.6%,PIArena全部四个攻击族的服从率降至0%,同时被标记片段保持可读(92.5%的精确复制率)。