论文

声学基础模型中的物理可实现触发后门

Backdooring Acoustic Foundation Models for Physically Realizable Triggers

模型评测模型训练应用与实践监督微调与指令调优安全与风险评测语音识别与转写

摘要

声学基础模型 (AFM) 实现了声学应用的民主化,能够以最少的资源实现从语音识别到说话人验证等任务的强大模型。然而,基于 AFM 的应用程序的安全性在很大程度上仍未得到充分探索。我们的工作通过提出基金会声学模型后门(FAB)攻击来解决这一差距,证明最先进的 AFM 在实际设置下很容易受到后门攻击。尽管对对手的能力做出了最小的假设(例如,无法访问预训练数据),但我们表明 FAB 保留了良好的性能,同时引入了后门,这些后门可以在微调中幸存下来,并在激活时导致各种下游任务的显着退化。值得注意的是,FAB 利用与任务无关、物理上可实现、不显眼且无需同步的触发器(例如背景警报器)。我们使用两个领先的 AFM、九个下游任务和四个不同的触发器来评估 FAB。我们进一步证明了其针对已建立的防御以及跨数字和物理领域的有效性。虽然广泛 端到端微调可以缓解 FAB,这种防御是资源密集型且针对特定任务的。我们的工作强调了 AFM 面临的重大风险,并呼吁采取先进的防御措施。

声学基础模型中的物理可实现触发后门:论文原图
图 1:FAB 攻击概述。在这个三阶段攻击中,对手:(1)从公共存储库下载良性 AFM 并注入与任务无关的后门; (2) 在公共平台上发布后门 AFM,并等待毫无戒心的受害者下载并针对下游任务进行微调(因为 AFM 在良性输入上获得了高性能); (3) 最终通过一个不显眼的、非破坏性的、无同步的、输入不可知的、物理上可实现的触发器(例如,吠叫的狗)与良性输入一起激活后门,以阻碍下游任务的性能。