论文
以低梯度开销增强语音深伪检测的跨域泛化
Source-Directed Trajectory Perturbation at First-Order Cost for Domain Generalization in Speech Deepfake Detection
摘要
当测试数据的分布与训练数据的分布不同时,语音深度伪造检测器通常会失去准确性。领域泛化元学习 (MLDG) 通过使用情景元训练和元测试分割来模拟领域转移,展现出了良好的前景。然而,MLDG 元目标仅考虑单个干净的适应轨迹,并且没有考虑其端点周围的局部损失景观。为了解决这个限制,我们首先提出了一个明确的最坏情况 MLDG 变体,称为 WC-MLDG-4P,它会扰乱元训练和元测试状态,但每集需要四次梯度评估。然后,我们介绍 WC-MLDG-2P,这是显式鲁棒目标的源导向替代方案。它将干净的 MLDG 端点转向局部更高的源损耗状态,并评估那里的元测试梯度,保留一阶 MLDG 的两次评估成本。一阶展开将产生的梯度变化与沿源梯度的元测试方向曲率相关联,而无需显式计算 Hessian。相对于MLDG,WC-MLDG-2P 使用 XLSR-AASIST 和 XLSR-Conformer-TCM 分别实现相对平均 EER 降低 23.4% 和 7.6%。
