论文
用于稳健音频 Deepfake 检测的神经音频编解码器
Neural Audio Codec for Robust Audio Deepfake Detection
摘要
尽管现实世界的音频通常采用低比特率编码,但音频深度伪造检测器通常在未压缩的音频上进行评估。在这项工作中,我们研究了音频编码如何影响跨编解码器、比特率和检测器的深度伪造检测,以较低的速率发现较高的错误。混合对协议隔离编解码器引起的真实和伪造音频变化,揭示不对称、与编解码器相关的故障:低速率 DAC 和 EnCodec 主要降低真实检测,而 X-Codec 显示出更强的伪造音频侧限制。受这些启发,我们提出了一种取证保护神经音频编解码器(FP-NAC),它使用检测器引导的目标微调预训练的编解码器,同时保留其原生硬量化路径和比特率。在 ASVspoof 2019 LA 上,与原始 DAC(0.5~kbps)相比,FP-NAC 将 EER 降低了高达 49.8个百分点,同时保持了相当的重建质量。尽管仅由一个检测器监督,但 FP-NAC 提高了多个检测器的性能,突出了取证透明度作为编解码器设计目标以及感知质量。我们的代码可在 https://github.com/kjungwoo03/FP-NAC. 获取