论文
快速中毒:针对快速响应框架的实际中毒攻击
Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework
摘要
部署在生产系统中的快速响应 (RR) 框架(包括 Anthropic 的 ASL-3 防护措施)不断改进越狱检测分类器。当出现绕过这些分类器的新越狱时,快速响应会生成用于训练的合成变体,帮助模型从新攻击中泛化并快速适应。我们发现,即时注入可以渗透到该管道中,将中毒样本传送到分类器的训练集中,从而实现两个攻击目标:(I) 有针对性的中毒攻击,通过将无害样本分类为越狱,并具有特定的所需功能(例如,某些格式、主题或关键字),对无害样本产生误报;(II) 基于概念的后门攻击,在越狱输入上引发误报,甚至在后门触发时,从防御者明确训练的攻击策略中推广到越狱存在。重要的是,我们的威胁模型限制对手仅修改越狱样本(而不是良性数据或标签),这是先前工作未探索的限制,这使得第二个目标特别具有挑战性。我们通过遗漏攻击来解决这个问题,它利用了一种新现象:当对缺乏概念的不安全样本进行训练时,分类器会将该概念的存在与安全标签错误关联。这两种攻击都会导致大量标签翻转,在某些情况下几乎完全翻转,中毒率仅为 1%,误报率高达 100%,漏报率高达 96%。