论文
水印捷径:出处标记如何破坏音频 Deepfake 检测
The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection
摘要
出处水印越来越多地被视为合成语音的保护措施,无论是直接构建到 Chatterbox 等语音生成模型中,还是通过 AudioSeal 等专用技术提供,或者由 ElevenLabs 等商业平台部署。我们发现了一个以前未表征的缺陷:当合成语音带有水印而人类语音没有时,与水印一起训练的检测器会作为虚假的“水印=>假”捷径锁定水印。这个单一功能会产生三个耦合故障:泛化退化(模型性能在未见过的数据上恶化)、剥离逃避(带水印的假语音一旦未加水印就会逃脱)和标记到帧(对真实语音加水印将其标记为假语音)。在受控白盒实验中,经过水印训练的检测器显示所有三个(例如,标记到帧将等错误率从 16% 提升到 75%)。在商业 API 的黑盒测试中,我们表明向真实语音添加水印会将其伪装成假语音。然而,这个捷径是可以修复的:在两个类上使用水印进行重新训练可以消除相关性并恢复干净的行为。我们将实验数据作为配对的干净与水印语料库(WASP)发布。