论文
NeuMark-Native:通过充分利用神经音频编解码器潜空间实现强大的文本到语音本地水印
NeuMark-Native: Robust Text-to-Speech-Native Watermarking Through Full Utilization of Neural Audio Codec Latent Space
摘要
语音水印为合成语音提供主动可追溯性,但大多数现有模型仅在文本到语音 (TTS) 合成后通过向生成的波形添加水印扰动来运行。这种事后设计将水印保留为可以省略或绕过的外部步骤,并将水印限制为浅层波形表示。我们提出了 NeuMark-Native,一种用于基于神经编解码器合成的 TTS 原生水印框架。它在波形解码之前将有效负载信息嵌入到每个生成的编解码器潜在层中,从而提高下游数字信号处理 (DSP) 和神经编解码器重新合成下的水印持久性。 NeuMark-Native 保持预训练的 TTS 模型和神经编解码器冻结,同时仅优化生成的编解码器token上的水印模块。在 11 种 DSP 攻击和 9 种神经编解码器攻击下对两个语料库进行的实验证明了强大的水印检测,同时保持了接近合成语音的自然性、清晰度和语音质量。
