论文

以低梯度开销增强语音深伪检测的跨域泛化

Source-Directed Trajectory Perturbation at First-Order Cost for Domain Generalization in Speech Deepfake Detection

模型评测模型训练参数高效训练安全与风险评测鲁棒性、公平性与可信度评测

摘要

当测试数据的分布与训练数据的分布不同时,语音深度伪造检测器通常会失去准确性。领域泛化元学习 (MLDG) 通过使用情景元训练和元测试分割来模拟领域转移,展现出了良好的前景。然而,MLDG 元目标仅考虑单个干净的适应轨迹,并且没有考虑其端点周围的局部损失景观。为了解决这个限制,我们首先提出了一个明确的最坏情况 MLDG 变体,称为 WC-MLDG-4P,它会扰乱元训练和元测试状态,但每集需要四次梯度评估。然后,我们介绍 WC-MLDG-2P,这是显式鲁棒目标的源导向替代方案。它将干净的 MLDG 端点转向局部更高的源损耗状态,并评估那里的元测试梯度,保留一阶 MLDG 的两次评估成本。一阶展开将产生的梯度变化与沿源梯度的元测试方向曲率相关联,而无需显式计算 Hessian。相对于MLDG,WC-MLDG-2P 使用 XLSR-AASIST 和 XLSR-Conformer-TCM 分别实现相对平均 EER 降低 23.4% 和 7.6%。

以低梯度开销增强语音深伪检测的跨域泛化:论文原图
图 1:学习检查点周围的局部交叉熵景观。每个面板使用相同的扰动范围和共享的 log10\log_{10} 损失尺度;红点标记未受干扰的检查点。