论文

用提示调优基础模型检测阿拉伯语语音伪造

UZH-CL at ArA-DF 2026: Prompt-Tuned Foundation Models and Track-Adaptive Score Fusion for Arabic Speech Deepfake Detection

模型训练模型评测应用与实践参数高效训练安全与风险评测语音交互与综合语音服务

摘要

对于方言多样性的低资源语言来说,检测合成和语音转换的语音仍然很困难,其中系统必须跨区域方言和看不见的声学通道进行泛化。我们向 ArA-DF 2026 阿拉伯语音深度伪造检测共享任务提交了 UZH-CL 提交的材料,涵盖 Track~1(方言泛化)和 Track~2(声学鲁棒性)。我们冻结 W2V-BERT-2.0 主干,并使用 \emph{Wavelet Prompt Tuning} 对其进行调整,更新参数低于 1%,并使用跨层注意力和通用注意力统计池头而不是专门的图后端聚合多层表示。通过改变适应策略、训练数据、增强和编码器系列来获得互补检测器。我们发现这两种转变类型需要不同的融合机制:用于方言泛化的广泛的多窗口集成,以及用于声学鲁棒性的紧凑的、通道匹配的、中心裁剪的集成。官方评估得出,Track~1 的 EER 为 1.96%(第 6 位),Track~2 的 EER 为 1.04%(第 3 位),与 XLS-R+AASIST 基线相比相对减少了 87% 和 96%。