论文
用于所有类型音频 Deepfake 检测的隐藏域路由
Hidden-Domain Routing for All-Type Audio Deepfake Detection
摘要
所有类型的音频深度伪造检测需要对语音、环境声音、歌声和音乐进行真实性判定,而音频类型在推理时不可用。在 AT-ADD Track2 中,此设置创建隐藏的音频域条件:二进制真/假标签跨域共享,但表示结构和检测器分数行为随音频类型而变化。我们提出了一个封闭条件路由系统,它首先恢复隐藏的音频域,然后解释所选分支内的检测器分数。 AudioType-BEATs-6s 路由器从 6 秒窗口估计音频类型;语音输入由 Speech-XLSR Expert 处理,而声音、歌唱和音乐则依赖于具有分支本地分数解释的基于 EAT 的通用音频专家。开发集表示分析、路由器系列比较和组件结果显示了跨音频类型的音频域分离和互补检测器优势。在官方AT-ADD Track2最终评测中,该系统Track2 Macro-F1得分达到96.10%,位居最终排行榜第一,语音、声音、歌唱、音乐各类型Macro-F1得分分别为88.07%、98.18%、99.07%、99.08%。这些结果支持在解释所有类型的音频深度伪造检测中的检测器分数之前恢复隐藏的音频域。