论文

追踪并重学 TTS 系统中的伪造检测证据

Tracing and Relearning Detection Evidence in Text-to-Speech Systems

模型评测安全与风险评测

摘要

音频深度伪造检测器能区分真实语音与合成语音,但检测证据来自文本转语音系统的哪个阶段仍不清楚。本文在F5-TTS-BigVGAN流程中通过受控再合成与检测器适配研究这一问题。由于真实梅尔频谱经声码器重建后,本身就可能与原始语音区分开,研究固定声码器,将检测器区分能力的较大变化追溯至声学生成阶段。在目标函数不包含检测器的情况下对声学模型进行对抗微调,在质量相当时提高了固定检测器的等错误率EER。然而,仅用微调模型生成的VCTK输出适配检测器,就使其在LibriSpeech上的EER从19.42%降至7.46%,并改善对未见过的基础F5-TTS输出的检测。这表明声学模型更新可减少固定检测器可用的证据,但检测器适配仍能让更新后的输出在该流程中被识别。

TTS伪造检测实验框架,分开控制声学生成、声码器和检测器适配。
图2(图注摘要):TTS伪造检测实验框架,分开控制声学生成、声码器和检测器适配。