论文

TransferBreaker:降低语音识别微调模型的对抗攻击迁移风险

Breaking Adversarial Transferability in Fine-Tuned Speech Recognition

模型评测模型训练应用与实践监督微调与指令调优安全与风险评测语音识别与转写

摘要

许多组织对公开可用的预训练自动语音识别 (ASR) 模型进行微调,并将其部署在黑盒设置中,假设有限的访问可以提供保护。我们表明这种假设是脆弱的:在公共基础模型上精心设计的对抗性扰动有效地转移到微调的目标模型,严重降低了性能并给安全关键型应用带来了担忧。我们提出了 TransferBreaker,一个统一的微调框架,通过集成基础对抗性微调来抑制对抗性转移,将对抗性训练限制为基础有效扰动;潜在雅可比正则化,通过抑制对抗性敏感方向来强制潜在空间不变性; HybridGrad-AFT,它通过从基础梯度和目标梯度中插入可传递扰动来提高针对自适应攻击的鲁棒性。我们从理论上证明了所有组件的合理性,并跨三种语言和四种大型 ASR 模型评估了 TransferBreaker,将对抗性 WER 从 92.6 降低到 27.8。我们的代码可在 https://github.com/rohban-lab/TransferBreaker。 上公开获取

TransferBreaker:降低语音识别微调模型的对抗攻击迁移风险:论文原图
图 2:TransferBreaker 框架。左:对抗扰动生成,包括基础扰动 (δbase\delta_{\text{base}}) 和 HybridGrad 扰动 (δhybrid\delta_{\text{hybrid}}),后者结合基础梯度和目标梯度来插值可转移的对抗方向。右图:使用具有任务损失(CTC 或交叉熵)和潜在雅可比正则化的干净对抗样本的训练循环,以强制潜在空间不变性并抑制对抗敏感方向。