论文

LambdaMark:用于鲁棒性和放射性的语义音频水印

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

AI 基础设施AI安全与内容治理基础设施

摘要

生成音频的最新进展使语音克隆变得越来越容易,从而导致语音欺诈、冒充和其他形式的未经授权的使用。常见的攻击会根据目标说话者的录音微调语音生成模型,使该模型能够合成该说话者的声音。音频水印通过将可检测信号嵌入音频中提供了一种有前景的防御。实用的水印必须满足两个关键属性:鲁棒性和放射性。现有的音频水印方法通常将信号嵌入到底层表示中,例如波形或频谱图,这使得它们容易受到信号级操纵的影响,并限制它们向下游模型的传输。我们推出 LambdaMark——第一个通用放射性水印方案。与之前的所有方法不同,LambdaMark 通过将多位水印信息嵌入到语义音频潜在表示中来实现通用放射性。我们的水印具有语义解释,因此更有可能由下游模型通过微调来学习。 LambdaMark 包括一个轻量级水印编码器,用于将多位消息相关扰动注入到语义音频表示中;还包括一个解码器,用于检测水印的存在并恢复嵌入的位信息。编码器和解码器使用自定义的多分量损失进行训练,该损失保留了带水印的音频的保真度,提高了位级恢复率,并提高了针对常见失真和对抗性删除尝试的鲁棒性。实验表明,LambdaMark 在常见畸变下实现了近乎完美的鲁棒性。 LambdaMark 也是唯一能够抵御所有评估的删除攻击的水印。此外,LambdaMark 表现出普遍且强大的放射性,即使对于这些微调模型生成的输出,也能抵抗扭曲和对抗性删除攻击。