论文
CoReLoop:用于音频 Deepfake 检测的参数高效受控循环细化
CoReLoop: Parameter-Efficient Controlled Recurrent Refinement for Audio Deepfake Detection
摘要
对于音频深度伪造检测器来说,推广到看不见的攻击仍然具有挑战性,并且收集涵盖所有潜在攻击的训练数据是不切实际的。我们在已经训练好的基于 SSL 的检测器中探索循环细化,无需额外数据或更改其原始参数。然而,直接回收编码器输出作为输入会降低我们诊断中的检测能力。我们提出了 CoReLoop,它通过调整冻结编码器的循环输入、控制状态更新以及将精细输出与冻结分类器对齐来使这种重用有效。通过仅在原始数据上训练轻量级细化模块和循环特定的低秩适配器,CoReLoop 可以实现额外的细化,同时保留检测器的原始首次通过预测。在 14 个跨域测试集上,24 层模型通过两次传递将合并等错误率 (EER) 从 4.85% 降低到 3.74%,598M 中大约有 10M 个可训练参数。为了有选择地应用此改进,可选的停止头会选择每个话语的深度,以平均 1.18 次传递实现 3.73% 的合并 EER。