论文

DuraMark:基于 LLM 的 TTS 中的持续时间嵌入水印

DuraMark: Duration-Embedded Watermarking in LLM-based TTS

AI 基础设施AI安全与内容治理基础设施

摘要

基于 大语言模型 (LLM) 的文本转语音 (TTS) 模型已经实现了卓越的语音克隆功能,引发了人们对潜在的 Deepfake 滥用的担忧。语音水印通过将可追踪信息嵌入到生成的语音中来缓解这种情况。主流水印方法在信号级别(波形或频谱图)运行,使得水印容易受到生成攻击(例如神经编解码器和声码器)。为了解决这个问题,我们提出了 DuraMark,一个强大的信息级水印框架。它利用音节持续时间编辑来实现水印嵌入。具体来说,DuraMark 集成了基于 LLM 的持续时间可控 TTS 模型,用于在合成过程中编辑音节持续时间,并结合持续时间提取器来提取这些持续时间进行检测。实验证明 DuraMark 针对生成攻击具有卓越的鲁棒性,显着优于信号级基线。音频样本可在 https://muzw.github.io/duramark_demo/ 获取。