论文

探索生成图像水印对抗潜在频率掩蔽的弱点

Exploring Weaknesses of Generative Image Watermarks against Latent Frequency Masking

模型评测安全与风险评测

摘要

隐形水印已成为追踪人工智能生成图像的核心工具,但其针对自适应删除攻击的鲁棒性仍然是一个悬而未决的安全问题。我们引入了潜在频率掩蔽,这是一种通过替换水印图像的潜在表示中选定的傅立叶系数来擦除水印证据的攻击。替换可以从高斯噪声中采样以提高效率,也可以从扩散再生中导出以改进图像保存。我们提供了一个与重建的对抗图像和屏蔽的潜在频率扰动之间的变化相关的理论失真界限。我们评估了针对 DiffusionDB 和 MS-COCO 提示生成的图像的六种扩散水印方法所提出的攻击。与现有攻击相比,潜在频率掩蔽可以去除或大幅削弱多个水印,同时保持感知质量并实现有利的运行时间。这些结果将潜在频率操纵确定为实际的攻击面,并强调需要将此类攻击纳入生成图像水印的鲁棒性评估中。