论文

SSTMark:强大的 无需训练 语义级语音水印

SSTMark: Robust Training-Free Semantic-Level Speech Watermarking

AI 基础设施AI安全与内容治理基础设施

摘要

随着语音生成模型变得越来越现实且广泛使用,对合成语音的滥用、归因和治理的担忧持续增长。水印提供了一种使合成语音可追踪和可验证的实用方法。大多数现有的语音水印方法将水印信息嵌入到信号级表示中,例如波形或频谱图。在足够强的扭曲下,嵌入的水印可能会被削弱或破坏,导致可检测性下降。在本文中,我们提出了 SSTMark,这是一种 无需训练 语音水印框架,通过文本水印在语义级别上运行。与传统的信号级水印方法不同,SSTMark 将水印信息编码到生成的语音所传达的语义内容中,并从恢复的语言内容中检测水印。 AudioMarkBench 上的实验表明,SSTMark 表现出最强的平均鲁棒性。与固定误报率为 1% 的最先进基线相比,SSTMark 在信号处理编辑和压缩编辑方面的平均检测率分别提高了 4.6% 和 16.9%。