论文
StreamMark:基于深度学习的半脆弱音频水印,用于主动 Deepfake 检测
StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection
摘要
生成式人工智能的快速发展使得区分深度伪造音频和真实的人类语音变得越来越困难。为了克服被动检测方法的局限性,我们提出了 StreamMark,一种新颖的基于深度学习的半脆弱音频水印系统。 StreamMark 旨在对保留语义意义(例如压缩、噪声)的良性音频转换具有鲁棒性,同时对恶意、语义改变操作(例如语音转换、语音编辑)仍然脆弱。我们的方法在独特的编码器-失真-解码器架构中引入了复杂域嵌入技术,经过明确训练以区分这两类转换。综合基准测试表明,StreamMark 实现了高不可察觉性(SNR 24.16 dB,PESQ 4.20),对 Opus 编码等现实世界的失真具有弹性,并且对一系列 Deepfake 攻击表现出原则上的脆弱性,消息恢复精度下降到偶然水平(约 50%),同时对基于良性 AI 的风格传输保持鲁棒性(ACC > 98%)。