论文

用于音频深度伪造检测的多骨干自监督集成以及生成检测不对称性的跨轨分析

Multi-Backbone Self-Supervised Ensembles for Audio Deepfake Detection and a Cross-Track Analysis of Generation-Detection Asymmetry

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

本文介绍了“Go-To-Germany”团队参与 ImageCLEF 2026 音频 Deepfake 检测和生成任务的情况。我们的检测系统建立在结合了 WavLM-Large、Wav2Vec2-XLS-R-300M、ECAPA-TDNN 和 x 向量表示的四主干自监督学习 (SSL) 集成的基础上,在官方 ImageCLEF 2026 评估中获得了 0.9522 的最终分数,在参与者生成的深度伪造品上达到了完美的准确率 (1.0000),在提供组织者真值真实数据。对于生成子任务,我们的官方团队提交的F5-TTS v1基线经过统一混响通道处理并作为故意反取证探针提交,最终得分为0.4304(单词错误率(WER)4.99%,字符错误率(CER)2.07%)排名第一;我们的四个模型程序(GLM-TTS、F5-TTS、XTTS v2、CosyVoice3)的详细信息(正式条目是从中提取的)出现在论文中。我们提出的跨轨分析揭示了明显的不对称性:我们的检测系统识别了 100% 的参与者生成的深度赝品,而我们的官方生成条目尽管在音频生成子任务中排名第一,并避开了 61.4% 和 56.2% 的参与者和组织者检测器,但最终得分为 0.4304,而检测方面的最终得分为 0.9522。我们进一步报告了基于伪造的消融实验(LOSO 56 说话人交叉验证、三区域主干几何、引导置信区间和 PCA 分析),这些实验激发了我们对多主干 SSL 集成的架构保险假设。我们通过五个跨跟踪见解和五个预先注册的伪造实验来补充这些结果,将生成端规避与检测端设计决策联系起来,并且我们公开报告了保留组织者真实录音的 11.25% 误报差距,作为部署的主要公开挑战。