论文
MusicMark:用于音乐生成的强大的生成水印框架
MusicMark: A Robust Generative Watermarking Framework for Music Generation
摘要
人工智能音乐生成与商业平台一起迅速发展,提高了对可靠水印的出处和归属的需求。然而,现有的音频水印研究主要集中在语音上,由于音乐结构复杂、声学纹理丰富,将面向语音的方法应用于音乐具有挑战性。大多数现有方法都是事后的,在生成后添加难以察觉的扰动,而不是嵌入水印作为内容的一部分。这使得它们在转换下变得脆弱,特别容易受到神经编解码器重新合成的影响,这可能会丢弃难以察觉的残留信号。此外,由于生成和水印是解耦的,因此可以绕过或省略水印步骤,从而削弱来源保证。为了解决这些问题,我们提出了 MusicMark,据我们所知,它是第一个音乐生成水印框架。具体来说,MusicMark 在生成过程中将水印消息嵌入到语义潜在空间中,将水印合并为音乐内容的一部分,并确保针对各种攻击(特别是神经编解码器重新合成)的鲁棒性。为此,我们将水印适配器引入基于扩散的生成模型中,以跨降噪步骤嵌入水印消息。适配器和检测器以联合目标进行训练,通过将带水印的潜在变量限制为接近其未加水印的参考潜在变量来保持保真度,同时通过攻击增强来提高鲁棒性。实验表明,MusicMark 在各种攻击(包括神经编解码器重新合成)中的性能显着优于事后基线,同时保持了可比较的生成质量。我们进一步引入了翻唱攻击,在保留音乐内容的同时转换歌声,并表明 MusicMark 仍然比事后方法更强大。