论文
Alethia:语音 Deepfakes 的基础编码器
Alethia: A Foundational Encoder for Voice Deepfakes
摘要
现有的语音深度伪造检测和定位模型严重依赖于从语音基础模型(SFM)中提取的表示。然而,下游微调目前已达到收益递减的状态。在本文中,我们将重点转移到预训练上,并提出了一种新颖的方法,将瓶颈屏蔽嵌入预测与基于流匹配的频谱图重建相结合。其成果 Alethia 是第一个用于各种语音深度伪造检测和定位任务的基础音频编码器。我们使用 56个基准数据集对 5种不同任务进行了评估,并注意到 Alethia 的性能显着优于最先进的 SFM,对现实世界的扰动具有卓越的鲁棒性,并且对未见过的领域(例如,唱 Deepfakes)具有零样本泛化能力。我们还证明了离散目标在屏蔽词元预测中的局限性,并展示了连续嵌入预测和生成预训练对于捕获深度伪造伪影的重要性。