论文
Overflip:重复诱导的防护模型标签翻转
Overflip: Repetition-Induced Label Flips in Guardrail Models
摘要
防护模型被部署用于筛选基于大语言模型服务中的恶意提示和响应。为满足延迟要求,许多轻量级防护模型采用紧凑的Transformer架构(如DeBERTa),在短上下文窗口(通常为512个token)下训练,并依赖分桶的相对位置编码处理更长的输入。以往评估假设输入长度增加时,防护模型的决策保持稳定。我们证明这一假设可能不成立。我们发现了Overflip现象,即在重复提示时,模型预测会从恶意(MAL)翻转为良性(BEN)随序列增长而发生。我们在9个广泛使用的轻量级防护模型上进行了实验,其中5个在包含100个提示的基准测试中出现MAL→BEN翻转,且置信度边界随重复次数增加而持续缩小。这些易受影响模型的翻转率范围为8%至92%,首次翻转发生在约2600至9400个token处。我们的分析表明,Overflip不同于传统的注意力稀释基线方法,后者通过良性填充或打乱等方式,将注意力从恶意内容token转向无关内容。尽管Overflip保留了恶意内容,但会均匀化重复结构中的token级注意力,并引发一种与填充不同的、更平缓的注意力分散轨迹。此外,Overflip对大语言模型服务的威胁大于传统注意力稀释方法。因为被绕过的提示在语义上保持完整,且仍能被下游业务大语言模型准确理解,恶意意图可在通过防护模型后继续传播。这些发现揭示了重复行为是防护模型的潜在攻击面,推动了对长度鲁棒性的评估与缓解机制的研究。
