论文

用于通用音频 Deepfake 检测的自监督语音模型中的探测引导层选择

Probing-Guided Layer Selection from Self-Supervised Speech Models for Generalizable Audio Deepfake Detection

模型训练参数高效训练

摘要

音频深度伪造检测系统通常无法跨领域推广,因为它们依赖于与特定攻击或记录条件相关的功能。自监督语音模型提供了丰富的多层表示,但现有方法要么使用单层,要么不加区别地融合所有层,并且仅在训练后揭示层的重要性。我们提出了一种与模型无关的两阶段方法,该方法可以在训练任何特定于任务的模型之前识别信息深度区域。在第一阶段,轻量级 XGBoost 探针评估每个 Transformer 层的跨域判别能力,产生层排名。在第二阶段,紧凑的神经分类器通过每层注意力池和共享瓶颈投影仅融合选定的层,而骨干网保持冻结状态。该探索应用于三个骨干网,揭示了两个关键发现。首先,信息层聚集在深度区域中,而不是在唯一的最佳位置:区域内替换属于多种子噪声,而区域违规会使性能降低高达 5 倍。其次,探测产生特定于骨干网的选择,而不是固定的层配方。在 XLS-R-300M 上,具有 1.34M 可训练参数的四个探测选择层在野外环境中实现了 4.94 +/- 0.32% 的相等错误率,在四个共享数据集上实现了 5.07% 的跨域平均错误率,比使用具有相同训练数据的所有 25 个层的最佳先验冻结骨干结果(Xiao 和 Vu,2025)相对提高了 28%。