论文

TRACE:通过语音基础模型的嵌入轨迹分析进行 无需训练 部分音频 Deepfake 检测

TRACE: Training-Free Partial Audio Deepfake Detection via Embedding Trajectory Analysis of Speech Foundation Models

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

部分音频深度伪造(将合成片段拼接成真实录音)尤其具有欺骗性,因为大多数音频仍然是真实的。现有的检测器受到监督:它们需要帧级注释,过度适合特定的合成管道,并且随着新的生成模型的出现必须重新训练。我们认为这种监督是不必要的。我们假设语音基础模型隐式编码取证信号:真实语音形成平滑、缓慢变化的嵌入轨迹,而拼接边界在帧级转换中引入突然中断。在此基础上,我们提出了 TRACE(通过嵌入动态进行基于 无需训练 表示的音频对抗),这是一个 无需训练 框架,通过分析冻结语音基础模型表示的一阶动态来检测部分音频深度伪造,无需任何训练、标记数据或架构修改。我们使用六种语音基础模型在跨越两种语言的四个基准上评估 TRACE。在 PartialSpoof 中,TRACE 达到了 8.08% 的 EER,与微调的监督基线相比具有竞争力。在 LlamaPartialSpoof(最具挑战性的基准测试,采用 LLM 驱动的商业合成)中,TRACE 在没有任何目标域数据的情况下完全超越了监督基线(24.12% vs. 24.49% EER)。这些结果表明,语音基础模型中的时间动态为 无需训练 音频取证提供了有效的泛化信号。