论文
AudioNoisePrints:在流匹配 TTS 中使用空间相关性的无模型音频水印
AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS
摘要
我们提出了 AudioNoisePrints,这是一种用于流匹配和扩散 TTS 模型的 无需训练 水印管道,它在推理过程中需要最少的额外计算,并且不需要重新训练 TTS 模型或降低生成质量。我们利用了扩散和流量匹配模型中初始高斯噪声与生成的输出之间存在强相关性的事实,使得初始噪声与生成的输出之间的简单余弦相关性可用于执行造水。此外,我们在顶部训练一个轻量级检测器以进行更积极的增强。我们的方法优于 AudioSeal,它是强增强下音频水印的强大基线。我们对 F5TTS 以及其他 TTS 和声码器模型进行了实验,得出的结论是它们都表现出相似的空间相关特性,这表明我们的水印方案可以在未来用于更多流匹配的 TTS 模型甚至声码器。