论文

用于高效音频 Deepfake 检测的任务感知联合修剪和蒸馏

Task-Aware Joint Pruning and Distillation for Efficient Audio Deepfake Detection

摘要

语音合成的进步使深度造假的语音变得越来越令人信服,对安全构成了越来越大的威胁。虽然基于自监督学习 (SSL) 的检测器实现了最先进的性能,但其计算需求(通常为 300M+ 参数)阻碍了在资源受限的设备上的部署。现有的压缩方法主要是为以内容为中心的任务而设计的,当直接适应深度伪造检测时,很难保持有竞争力的性能。我们提出了一个任务感知联合剪枝和蒸馏框架,该框架将跨领域知识蒸馏与运动引导的结构化剪枝相结合,以传输伪造辨别知识并在积极压缩下保留关键结构。我们的框架将模型减少到 31.9M 参数,并减少了 6.3$\times$ FLOPs,与未压缩的基准相比,多个数据集的平均性能下降仅为 1.30\%,展示了设备上部署的强大潜力。

用于高效音频 Deepfake 检测的任务感知联合修剪和蒸馏的原论文方法或结果图
图1:任务感知联合剪枝和蒸馏框架:(1)特定于任务的准备; (2)联合修剪和蒸馏; (3)后端优化。压缩模型可实现高效的设备上深度伪造检测。