论文
TTS-Guard:用自适应对抗说话人对指纹验证语音模型所有权
TTS-Guard: Black-Box Ownership Verification of Text-to-Speech Models via Adaptive Adversarial Speaker-Pair Fingerprints
摘要
零样本文本转语音 (TTS) 模型的快速成熟已将高质量语音克隆转变为一种广泛可用的功能,引发了对未经授权的复制、微调和转售专有语音模型的严重担忧。然而,TTS 的所有权验证在很大程度上仍然是开放的:语音是一种连续波形,其扰动很容易被常规信号处理破坏,而人类听觉系统施加的感知预算比视觉严格得多。我们提出了 \textbf{TTS-Guard},这是一个基于 \emph{对抗性说话人对指纹} 构建的 TTS 模型的黑盒所有权验证框架。 TTS-Guard(i) 在 \emph{dual} 嵌入空间中选择关键说话人对,以实现与架构无关的隐形;(ii) 通过影子模型的 \emph{自适应课程} 优化扰动,涵盖微调、修剪、量化和蒸馏; (iii)将黑盒查询聚合成校准的\emph{验证置信度得分}。在五个主流 TTS 系统上,TTS-Guard 的平均指纹成功率达到 $96.4\%$,误报率为 $5.8\%$,同时保持清晰度和自然度。该指纹对于十次音频攻击、六次模型修改和两个最先进的对抗净化器仍然有效。