论文

文本到图像模型的持久水印

Persistent Watermarking of Text-to-Image Models

模型训练监督微调与指令调优

摘要

文本到图像(T2I)生成越来越受到公众的欢迎,鉴于其昂贵的训练成本,推动了可靠机制的开发,以对此类模型进行版权保护。攻击者可能会在未经授权的情况下获取并重用预训练的 T2I 模型,然后通过 API 服务提供修改后的版本。此类修改可能源于普通的下游适应或故意删除所有权的尝试,包括输入提示预处理、模型微调和输出后处理。因此,从模型所有者的角度来看,一个关键的挑战是嵌入在此类变化下保持持久性的触发数据,同时保留模型的正常图像生成功能。在这项工作中,我们提出了一种对比式水印目标,其中一项明确鼓励水印模型在触发输入上的行为与原始模型不同。实验表明,在广泛的下游修改和有意削弱水印的尝试中,触发数据持久性比先前的方法要强得多,从而导致更高的检测率,通常接近 100% TPR@FPR<$10^{-4}$。