论文

GenTraceBench:在训练前后阶段追踪音频 Deepfakes 的基准

GenTraceBench: A Benchmark for Tracing Audio Deepfakes Across Pre- and Post-training Stages

模型评测基准与评测资源

摘要

现代文本转语音 (TTS) 系统很少部署为未更改的预训练模型。它们通常通过监督微调 (SFT) 或偏好优化(例如 DPO 和 GRPO)进行调整。这为音频深度伪造取证提出了一个实际问题:从基础生成器学习的指纹在适应后仍然有效吗?我们推出了 GenTraceBench,这是一个受控基准,涵盖 5 种 TTS 架构、16 种训练前/训练后变体以及使用固定文本和说话人提示生成的 49,728 条话语。在基础训练、适应测试协议下,我们评估二进制检测、闭集归因和开放集验证。 DPO 和 GRPO 通常会保留指纹,而一些 SFT 和预训练数据的更改会导致显着的漂移;三个法医骨干的效应大小各不相同。重复的训练运行证实了最大的 W2V-BERT 归因下降,而具有可比语音质量的数据混合控制表明成分变化不一定会导致漂移。在 W2V-BERT 验证中,多次注册将 SFT 条件下的 EER 从 44.4% 降低到 11.0%,而仅 SingNet 条件下的 EER 保持在 45% 或以上。