论文

超越言语:双域 SSL Fusion 用于统一全类型音频 Deepfake 检测

Beyond Speech: Dual-Domain SSL Fusion for Unified All-Type Audio Deepfake Detection

应用与实践结构化分析、预测与决策

摘要

统一全类型音频 Deepfake 检测旨在确定输入片段的音频类型可能是语音、环境声音、歌声或音乐时的真假。现有的以语音为中心或依赖于类型的解决方案不足以满足此设置,因为测试时音频类型未知,而所需的输出仍然是单个二进制决策。为了解决这些问题,本文提出了一种双域 SSL 融合方法,将异构音频映射到共享的二进制真实性空间。 EAT-large 和 wav2vec 2.0 XLS-R-300M 用作互补的 SSL 特征源,提供广泛的声学和事件级表示以及波形级、声音和语音敏感表示。逐层加权融合集成了来自不同 Transformer 深度的多级工件,而 词元级 融合形成了统一的特征池,而无需在两个 SSL 流之间强制执行帧级对齐。融合的词元通过多头注意力统计池进行汇总,并使用二进制 MLP 头进行分类。通过在此统一核心检测器之上应用保守的语音细化,所提交的系统在 AT-ADD Track 2 评估集上实现了 95.58% Macro-F1,并在挑战中排名第二。