论文

通过分层稳定实现语音基础模型的可转移对抗鲁棒性

Transferable Adversarial Robustness for Speech Foundation Models via Hierarchical Stabilization

模型评测鲁棒性、公平性与可信度评测

摘要

冻结语音基础模型 (SFM) 使下游适应变得高效:当任务学习层融合和轻量级分类器时,骨干模型可以保持固定。完全对抗性微调是实现稳健性的标准途径,但生成对抗性示例并为每个任务更新骨干模型会牺牲效率。我们询问是否可以在知道未来任务之前学习鲁棒性。对于冻结的骨干模型和线性分类器,可以通过表示稳定性和决策边界裕度之间的相互作用来理解鲁棒性。这直接导致了我们的设计:我们稳定了整个隐藏层的表示,而不仅仅是最后一层,同时保留了干净的表示;在干净适应选择层混合之后,我们将其保持固定并仅扩大分类器边缘,而没有下游对抗性示例。我们在自适应 30 dB 攻击下的四项任务上评估了 Wav2Vec2、HuBERT 和 WavLM Large。在 12 个骨干模型任务对中,分层稳健性将鲁棒精度提高了 46.4 pp,而裕度细化则增加了 4.0 pp,干净精度提高了 1.1 pp。代码和配置可在 https://github.com/arefmousavi/hierarchical-robust-sfm. 获取

通过分层稳定实现语音基础模型的可转移对抗鲁棒性的原论文方法或结果图
图 1:拟议框架概述。第一阶段在下游任务已知之前增强隐藏层的表示,同时保留干净的表示。然后,干净的适应学习特定于任务的凸层融合和线性分类器,并冻结稳健的骨干模型。第 2 阶段修复了骨干模型和融合,并仅使用归一化几何边距细化分类器。