论文
MelShield:强大的 Mel 域音频水印,用于 AI 生成的合成语音的来源归属
MelShield: Robust Mel-Domain Audio Watermarking for Provenance Attribution of AI Generated Synthesized Speech
摘要
在本文中,我们提出了 MelShield,这是一种强大的、新一代的、键控的音频水印框架,可将可识别信号嵌入人工智能生成的音频中,以实现版权保护和可靠归属。具体来说,MelShield 在生成过程中在 Mel 频谱图域中运行,针对 Mel 条件管道中的中间声学表示进行文本转语音 (TTS) 生成。核心思想是将中间梅尔频谱图视为主信号,并通过在波形合成之前分布在精心选择的时频区域的低能量、键控扩频扰动嵌入短二进制有效负载。通过在声码器推理之前执行水印处理,MelShield 对于 Mel 调节的 TTS 架构保持即插即用,并且不需要修改或重新训练底层 TTS 生成声码器,例如 DiffWave 和 HiFi-GAN。此外,多用户密钥结构实现了可扩展的用户特定归因,而密钥验证机制限制了未经授权的解码,从而降低了大规模提取器探测和对抗性分析的风险。 DiffWave 和 HiFi-GAN 上的大量实验表明,即使在信号失真(例如压缩和附加噪声)的情况下,MelShield 也能实现可靠的水印提取,接近 100% 的位精度,同时保持高感知音频质量。