论文

语音增强下神经音频水印的漏洞

The Vulnerability of Neural Audio Watermarks under Speech Enhancement

模型评测安全与风险评测

摘要

神经音频水印越来越多地部署在商业语音生成系统中,以使人工智能生成的语音可追踪,但其鲁棒性主要在传统信号失真下进行研究。由于水印可以被视为添加到语音信号中的难以察觉的噪声,因此一个自然的问题是语音增强(SE)作为去噪模型是否可以去除它。在本文中,我们将高斯噪声与 SE 模型级联作为黑盒水印去除攻击,涵盖判别性和生成性 SE 范式,针对六种神经水印:AudioSeal、WavMark、SilentCipher、Timbre、Perth 和 AlignMark。实验结果表明,所提出的攻击在水印去除方面明显优于现有的神经重新合成方法。特别是,我们发现生成 SE 在去噪的同时重建语音的谐波区域,对水印具有很强的破坏性。这些发现表明 SE 对当前的音频水印方法构成了严重威胁,我们呼吁在水印设计中进行 SE 感知的鲁棒性评估。