论文
TransferBreaker:降低语音识别微调模型的对抗攻击迁移风险
Breaking Adversarial Transferability in Fine-Tuned Speech Recognition
摘要
许多组织对公开可用的预训练自动语音识别 (ASR) 模型进行微调,并将其部署在黑盒设置中,假设有限的访问可以提供保护。我们表明这种假设是脆弱的:在公共基础模型上精心设计的对抗性扰动有效地转移到微调的目标模型,严重降低了性能并给安全关键型应用带来了担忧。我们提出了 TransferBreaker,一个统一的微调框架,通过集成基础对抗性微调来抑制对抗性转移,将对抗性训练限制为基础有效扰动;潜在雅可比正则化,通过抑制对抗性敏感方向来强制潜在空间不变性; HybridGrad-AFT,它通过从基础梯度和目标梯度中插入可传递扰动来提高针对自适应攻击的鲁棒性。我们从理论上证明了所有组件的合理性,并跨三种语言和四种大型 ASR 模型评估了 TransferBreaker,将对抗性 WER 从 92.6 降低到 27.8。我们的代码可在 https://github.com/rohban-lab/TransferBreaker。 上公开获取
